2024 年初,做大模型只有两条路。
第一条路:做一个密集模型。就像让一个天才什么都会,所有知识都装在一个大脑里。OpenAI 的 GPT-4 走这条路。效果最好,但也最贵。
第二条路:做一个混合专家模型,MoE。就像开一家医院,每个科室只看自己的病。病人来了,先分诊,然后送到对应的科室。每个专家只处理自己擅长的部分。
但 DeepSeek 选了一条更笨的路。当时所有做 MoE 的人,都把专家做得很大——每个专家是一个巨大的神经网络。DeepSeek 反其道而行:把专家切碎。
他们发现,专家太大了,学的东西就会重复。如果把一个大专家拆成 8 个,总参数不变,但每个小专家可以学不一样的东西——一个学语法,一个学数学,一个学代码。这就是细粒度专家混合。再加上一个共享专家来兜底,确保常见问题总有人能处理。
V1 证明了方向,但有个致命问题——太慢了。
问题出在注意力机制上。每个 token 在处理时,都要回过头去看前面所有的 token。看过的结果要存起来——这叫 KV 缓存。
DeepSeek 的团队问了一个问题:这些便签能不能写得精简一点?
他们发明了 MLA——多头潜在注意力。核心思想很简单:不要直接存 KV 缓存,而是先把它压缩到一个更小的空间里。就像你把一张 4K 照片压缩成 JPEG——虽然损失了一些细节,但你认得出照片里的人,而且文件小了 90%。
V2 有架构,但还差一样东西——规模。
2024 年底,DeepSeek 放了一个大招:DeepSeek-V3。671B 总参数,37B 激活。但这个模型最惊人的不是它有多大,而是它训练有多便宜。
怎么做到的?两个关键创新。
第一,FP8 训练——用 8 位精度代替 16 位。就像你用 MP3 代替 CD,音质差一点,但文件小了 50%,速度翻倍。
第二,MTP——多 token 预测——传统模型一次预测下一个词,V3 一次预测未来 2 个词。训练时效率更高,推理时还能用来做自我猜测加速。
2025 年 1 月,DeepSeek 发了一篇论文,让整个 AI 圈炸了。
标题很平淡:用强化学习激发大模型的推理能力。但内容很炸裂。他们做了一个实验:给 V3 的基础模型一堆数学题,然后说——你做吧,做对给分,做错扣分。但我不教你怎么想。
这就是 R1-Zero——纯强化学习,没有任何人类数据。训练过程中,发生了一件神奇的事:模型开始对自己说 wait。
这就是那个著名的 Aha Moment。机器人学会反思了。
2026 年 4 月,DeepSeek 发布了 V4。这一次,他们解决的是 LLM 最顽固的问题——上下文窗口。
大多数模型读到 5000 字以后,就开始忘记前面说了什么。这不是模型不聪明,是注意力机制的二次复杂度——你给模型读 10 倍的文字,它要多花 100 倍的计算。
V4 的思路不是把注意力做得更强,而是放弃一个注意力搞定所有的想法。他们用了三套不同的注意力机制,各司其职。
另外还有一个结构性的改进——mHC,就是我们之前说的那个路由器故事。不让信号随意放大,确保每一层的信息传递是稳定的。效果:信号只放大 1.6 倍(不是 3000 倍),模型训练再也不崩了。
2026 年 7 月 15 日,DeepSeek 发布了 V4 正式版——他们管它叫满血版。
同一天,他们宣布了一个全行业都没见过的新模式:峰谷计价。
你可能觉得,这不就是涨价吗?但 DeepSeek 的逻辑不是涨价,而是算电协同。
GPU 集群跑起来,最大的成本不是显卡,是电。白天大家上班都在用,算力堵车,GPU 满负荷转,电费最贵。到了半夜,大多数人不调 API 了,集群空闲,电也便宜了。DeepSeek 的逻辑很简单:谁在高峰期占算力,谁多付钱。谁在低谷期用,谁享受优惠。
这意味着什么?DeepSeek 正在从一个"科技公司的 AI 模型",变成一个像水、电、网络一样的基础设施。你不需要想"今天该不该用 AI",而是想"现在是峰时还是谷时"——就像你想洗衣服之前会看一眼电价时段一样。
与此同时,DeepSeek 还补上了最后一块拼图——多模态视觉能力。V4 现在能看懂图片了:识别物体、读取图表、分析截图、提取文档文字。他们用了一个叫 Visual Primitives 的技术,模型在思考时会直接标出物体的坐标,就像用手指指着说"看这里",而不是费力地用文字描述。
而且还在继续进化。V4.1 已经在灰度测试,新增了音频输入和 MCP 协议支持。DeepSeek 正在从纯文本模型,变成一个能看、能听、能调工具的完整平台。Web 和 App 上这些视觉功能全部免费,不需要任何订阅。
两年时间,从 V1 到 V4。DeepSeek 没有哪一项技术是天降神兵。MoE 不是他们发明的,注意力不是他们发明的,强化学习不是他们发明的。
但他们在每个关键节点上,都做对了选择:
每一个选择,在当时看起来都像铤而走险。但放在一起,它们拼出了一条完整的路。
这就叫系统级的创新——不是靠一个天才想法,而是靠一系列正确的工程决策累加起来。
这,就是 DeepSeek 的故事。
[1] DeepSeek-MoE — Dai et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models. arXiv:2401.06066.
[2] DeepSeek-V2 / MLA — DeepSeek-AI (2024). DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. arXiv:2405.04434.
[3] DeepSeek-V3 — DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437.
[4] DeepSeek-R1 — DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
[5] DeepSeek-V3.2 / DSA — DeepSeek-AI (2025). DeepSeek-V3.2 Technical Report.
[6] mHC — Xie et al. (2025). mHC: Manifold-Constrained Hyper-Connections. arXiv:2512.24880.
[7] DeepSeek-V4 — DeepSeek-AI (2026). DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.
[8] GVR Sparse Attention — Cheng et al. (2026). Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell. arXiv:2604.22312.
[9] DeepSeek V4 Vision — DeepSeek-AI (2026). Visual Primitives: Teaching Models to Think by Pointing.
风格笔记:每个概念必有类比,每段先抛为什么再讲是什么,避免并列介绍改成因果链,关键数字用红色强调,有起伏有情感高点,用简单疑问句推进,收尾有沉淀。