Tag
共 3 篇 · 标记为「性能优化」
一个头只学一种关系?太慢。本文将多头注意力的并行分头、独立投影、Concat 全流程用 TypeScript 实现,并对比单头与多头的注意力模式差异。
对话越来越长,LLM 的 Token 窗口却有限。用 gpt-tokenizer 精确计算 Token 数,实现倒序截断、保留最新消息的上下文管理方案。附带 Token 计算原理和滑窗策略对比。
不依赖后端,在浏览器里直接运行 AI 模型。从模型选型、量化加载、IndexedDB 缓存到 WebWorker 隔离,一文打通前端本地 AI 的完整工程链路。