国产大模型发展轨迹 · 全景图

从追赶开源到全球前沿——国产模型的里程碑、技术突破与核心论文
整理时间:2026.07 · 涵盖 DeepSeek、Kimi/Moonshot、Qwen/阿里、智谱GLM、百川、零一万物等

一、国产模型主要玩家

当前国产大模型格局——五大核心阵营,各有侧重。
深度求索 · DeepSeek
DeepSeek-V2/V3/V4 · R1 · Coder · Math · Prover
最强开源系列,MoE+MLA+GRPO 核心创新,1.6T 参数 V4 全球领先
月之暗面 · Moonshot AI
Kimi K1.5 / K2 / K2.5 · Kimi Linear / KDA
Agent 智能体赛道领先,1T MoE 开源,KDA 线性注意力架构突破
阿里 · Qwen
Qwen3-235B-A22B · Qwen-Coder · Qwen-VL
全模态覆盖,30B 参数到 235B MoE,多语言多任务均衡最强
智谱AI · GLM
GLM-4 · GLM-Z1 · CodeGeeX
自研 GLU 架构,学术背景深厚,多模态和 Agent 能力突出
字节跳动
Doubao · 豆包 · GR-2
C端用户量领先,多模态视觉理解,万亿 MoE 架构
百度 · 文心
ERNIE 4.5 / 5.0
最早布局,ERNIE 5.0 多模态理解,中文 NLP 积累深厚

二、发展时间线

从 2023 年 ChatGPT 冲击到 2026 年全球领先——每个节点都是技术迭代的关键一步。
2022-2023 · 觉醒与起步
2022.11
ChatGPT 发布,国产模型加速追赶
OpenAI 的冲击刺激国内迅速跟进。百度文心一言、阿里通义千问、智谱 ChatGLM 等纷纷发布。
2023.03
智谱 ChatGLM 开源
GLM-130B 后推出 ChatGLM-6B,首个可本地部署的中文开源大模型,学术导向。
2023.07
百川 Baichuan 系列发布
搜狗创始人王小川创立百川智能,发布 Baichuan-7B/13B,国产首批高质量开源通用模型。
2023.08
零一万物 Yi 系列
李开复创立零一万物,发布 Yi-34B,在当时的中文榜单多次夺得第一。
2023.10
月之暗面 Kimi Chat 上线
杨植麟团队推出 Kimi Chat,主打长文本理解(首批 200K 上下文),产品体验口碑爆棚。
2023.11
DeepSeek Coder:国产代码模型起点
DeepSeek 发布代码模型,仓库级预训练 + FIM 机制,HumanEval 79.3% 超 GPT-3.5。
🏁 首战
2024 · 架构革新之年
2024.01
DeepSeek-MoE:细粒度专家混合
提出 fine-grained MoE 分割方案 + shared expert,每个 token 激活多个细粒度专家。在 2T token 上验证了架构效率。#19 论文
里程碑 MoE 革新
2024.02
DeepSeekMath:数学推理突破
用 fastText 从 CommonCrawl 提取 120B token 数学语料,GRPO 算法雏形在此出现。GSM8K 82% 开源领先。
2024.05
DeepSeek-V2 + MLA:国产里程碑
Multi-Head Latent Attention (MLA) 提出——低秩 KV 压缩,推理成本骤降。MoE 236B/21B 激活,标志着国产模型首次在全球架构层面做出原创贡献。#10 论文
全球首创 KV 缓存革命
2024.06
DeepSeek-Coder-V2:代码开源新标杆
236B MoE + 2.4B 激活 Lite 版,338 种语言,HumanEval 90.2% 逼近 GPT-4,128K 上下文。首个在 SWE-Bench 突破 10% 的开源模型。
2024.06
Qwen2 系列发布
阿里 Qwen2 系列(0.5B-72B),MoE 模型 Qwen2-A57B-A14B,GQA 注意力,全面覆盖多语言多任务场景。
2024.08
Kimi K1/K1.5:长上下文 + 强化学习
月之暗面推出 Kimi K1.5,采用长上下文 + RL 训练策略,在 math/code 任务上展示出类 o1 的推理能力。
2024.12
DeepSeek-V3:671B MoE 正式发布
671B 总参/37B 激活,Multi-Token Prediction (MTP)、Auxiliary-Loss-Free Load Balancing、FP8 训练。仅用 2.788M H800 小时,训练成本 ~$5.5M。性能直逼 GPT-4。论文进行中
2024 标志 成本革命
2025 · 推理能力 + 开源爆发
2025.01
DeepSeek-R1:开源推理模型的里程碑
GRPO (Group Relative Policy Optimization) 强化学习驱动推理。AIME 2024 79.8% 超越 OpenAI o1。R1 蒸馏出 1.5B-70B 小模型。引爆全球 AI 社区。论文进行中
全局里程碑 开源震动
2025.03
DeepSeek-V3.2:稀疏注意力 DSA
DeepSeek Sparse Attention (DSA) 引入 MQA indexer + Top-K 稀疏注意力。YaRN 扩展上下文至 128K。NVFP4 量化在 B200 上高效推理。
2025.04
Kimi K2:1T 参数开源 Agent 模型
384 专家/32.6B 激活,MuonClip 优化器解决注意力 logit 爆炸。3000+ 真实 MCP 工具 + 20000 合成工具的 Agent 合成训练。SWE-bench 65.8%,全球开源 Agent 第一。论文待处理
Agent 标杆 MuonClip
2025.04
Qwen3-235B-A22B:思考模型新高度
阿里 Qwen3 系列,235B MoE/22B 激活。支持非思考/思考双模式切换。AIME 2024 40.1% (think mode 81.2%)。训练 36T+ tokens,多语言能力行业领先。
2025.10
KDA (Kimi Delta Attention):线性注意力新范式
Kimi Linear 技术报告——通道级细粒度遗忘门 + 约束 DPLR 矩阵计算。KV 缓存减少 75%,1M 上下文解码加速 6.3x。首次在同等对比下全面超越完整注意力。#28 论文
架构创新 线性注意力
2026 · 全球领先
2026.01
mHC:从 DeepSeek 走出的残差革命
Manifold-Constrained Hyper-Connections——双随机流形约束确保恒等映射,Amax Gain 从 3000 降到 1.6。仅 6.7% 额外开销。#39 论文
理论创新
2026.04
DeepSeek-V4:1M 上下文 + 混合注意力
CSA (Compressed Sparse Attention) + HCA (Heavily Compressed Attention) 双轨混合注意力。1.6T 总参/49B 激活。KV 缓存仅标准方案 2%。1M 上下文 LongBench 全面领先。论文待处理
2026 里程碑 1M 上下文
2026.05
DeepSeek-Prover V2:形式化数学的国产突破
形式化数学证明方向持续突破。Putnam 2025 满分 120/120,完成所有 6 题的形式化验证——全球首个达到此水平的开源模型。
2026.06
Scaling Multi-Node MoE:国产推理效率研究
DeepSeek V3/Qwen3/Llama-4 实测分析,发现专家激活模式可预测、可聚类。数据驱动的微批分组 + 专家放置算法,A2A 通信减少 20%。论文待处理

三、国产模型核心技术贡献

MLA · Multi-Head Latent Attention (DeepSeek-V2, 2024)
低秩 KV 投影压缩至 1/4d 隐空间,推理时 KV 缓存降为 MHA 的 1/16。全球原创,已为后续所有国产模型采纳。#10
GRPO · Group Relative Policy Optimization (DeepSeek-R1, 2025)
无需 Critic 模型的强化学习——对同一 prompt 采样多组输出,以组内相对优势估计替代价值函数推理,极大简化 RL for Reasoning 的训练流程。
KDA · Kimi Delta Attention (Kimi Linear, 2025)
通道级遗忘门 (Diag(α)) 替换标量门控 + 约束 DPLR (a=b=k) 提升硬件效率 2x。混合 3:1 KDA:MLA 架构,首次让线性注意力全面超越完整注意力。
MuonClip · 缩放安全的优化器 (Kimi K2, 2025)
Muon + QK-Clip 机制解决大规模训练中注意力 logit 爆炸。监控每头 max logit,超阈值时缩放 QK 权重。15.5T token 训练零 loss 尖峰。
mHC · 流形约束超连接 (DeepSeek, 2025)
双随机流形投影确保 n 流残差信号稳定传播。Sinkhorn-Knopp 迭代实现。DeepSeek-V4 的生产级残差方案。
CSA/HCA · 混合稀疏注意力 (DeepSeek-V4, 2026)
压缩稀疏注意力 (CSA, m=4 + DSA Top-K) + 重度压缩注意力 (HCA, m'=128) + 滑动窗口 (128) 三轨并行。1M 上下文 KV 仅标准方案 2%。

四、国产模型相关论文索引

已精读的国产模型核心论文,按时间排序。

更多架构通用论文(Transformer、RMSNorm、RoPE、Mamba 等)参见 全球演进故事线