Tag

#深度学习

共 5 篇 · 标记为「深度学习」

AI 解读算法实践从 Encoder-Decoder 到 Decoder-Only:Transformer 架构进化史与选型指南
2026年7月23日◷ 8 分钟阅读

从 Encoder-Decoder 到 Decoder-Only:Transformer 架构进化史与选型指南

为什么 BERT 是双向的、GPT 是单向的、T5 又要同时有 Encoder 和 Decoder?本文从架构层面讲清三种 Transformer 变体的设计哲学和选型指南。

阅读全文 →
AI 解读Layer Normalization 彻底搞懂:为什么 Transformer 用 LN 而 CNN 用 BN?
2026年7月23日◷ 8 分钟阅读

Layer Normalization 彻底搞懂:为什么 Transformer 用 LN 而 CNN 用 BN?

Batch Norm 统治了 CV,Layer Norm 统治了 NLP。本文从数学公式、梯度计算到 TypeScript 实现,彻底讲清两者的差异及 Transformer 选择 LN 的根本原因。

阅读全文 →
AI 解读Multi-Head Attention 从数学到代码:TypeScript 并行多头实现完全指南
2026年7月23日◷ 8 分钟阅读

Multi-Head Attention 从数学到代码:TypeScript 并行多头实现完全指南

一个头只学一种关系?太慢。本文将多头注意力的并行分头、独立投影、Concat 全流程用 TypeScript 实现,并对比单头与多头的注意力模式差异。

阅读全文 →
AI 解读Positional Encoding 彻底搞懂:正弦/余弦编码的数学原理与 TypeScript 实现
2026年7月23日◷ 8 分钟阅读

Positional Encoding 彻底搞懂:正弦/余弦编码的数学原理与 TypeScript 实现

Transformer 替换掉 RNN 后,模型失去了天然的位置感知能力。本文从数学直觉出发,详解正弦/余弦位置编码的原理,并用 TypeScript 实现可视化工具。

阅读全文 →
AI 解读Self-Attention 机制深度解析:Q、K、V 的数学直觉与 TypeScript 实现
2026年7月23日◷ 9 分钟阅读

Self-Attention 机制深度解析:Q、K、V 的数学直觉与 TypeScript 实现

彻底搞懂 Transformer 核心组件 Self-Attention:从 Q/K/V 矩阵计算到数值稳定性优化,手把手用 TypeScript 实现一个可在浏览器运行的自注意力计算器。

阅读全文 →
Michael.Meng

michaelnews@126.com
用 AI 记录,用文字沉淀

© 2026 Michael Meng · 保留所有权利 · Powered by FastAPI + Nuxt