写代码,也记录技术背后的判断与取舍。

  1. Transformer 到底在算什么?一文看懂 Attention↗ 大语言模型从零到一 · 03

    Token 进入模型后经历了什么?本文将从 Embedding 和位置信息开始,逐步拆解 Self-Attention、QKV、多头注意力、MLP、残差连接和 KV Cache,帮助读者理解 Transformer 每一层究竟在计算什么。

    8 分钟阅读
  2. 大模型吃进去的是什么?从互联网数据到 Token↗ 大语言模型从零到一 · 02

    大模型并不是把互联网内容直接塞进 GPU。本文将沿着数据生产流程,讲清网页解析、质量过滤、内容去重、数据混合和 Tokenization,并解释训练数据与 Tokenizer 如何共同影响模型最终的能力。

    9 分钟阅读
  3. 一句话讲清 LLM:为什么预测下一个 Token 也能产生智能?↗ 大语言模型从零到一 · 01

    从 Token、概率分布与训练目标出发,解释大语言模型为什么通过预测下一个 Token 产生知识、推理与生成能力。

    8 分钟阅读