一个全面的博客,深入学习大型语言模型(LLM)的方方面面:分词、注意力机制、位置编码等
项目
我一直在深入研究大型语言模型(LLM)的内部结构,并开始记录我的发现。我的博客涵盖了以下主题:
- 分词技术(例如,BBPE)
- 注意力机制(例如,多头注意力(MHA)、多查询注意力(MQA)、多层注意力(MLA))
- 位置编码和外推(例如,RoPE、NTK感知插值、YaRN)
- 像QWen、LLaMA等模型的架构细节
- 包括监督微调(SFT)和强化学习的训练方法
如果你对LLM的内部机制感兴趣,欢迎查看我的博客: [http://comfyai.app](http://comfyai.app)
返回首页