NEWS
行业动态
NEWS
OpenAI 发布了 GPT-5 Turbo,作为 GPT-5 系列的轻量高效版本,旨在为生产环境提供更具性价比的 AI 能力。
## 核心特性
- **性能与效率**:GPT-5 Turbo 采用了改进的模型蒸馏技术,在保持 GPT-5 90% 以上性能的同时,将模型体积压缩了 60%。推理速度提升了 3 倍,首 token 延迟降低至 200ms 以下。
- **定价策略**:API 定价相比 GPT-5 降低了 50%,输入 token 价格为 $2/百万 token,输出为 $8/百万 token。这一价格使得大规模 AI 应用的经济性大大改善。
- **长上下文优化**:高效支持 128K token 上下文窗口,在长文档处理场景下的吞吐量比 GPT-5 提升了 2.5 倍。
## 应用场景
OpenAI 表示 GPT-5 Turbo 特别针对实时应用场景进行了优化,首批用户包括多个大型 SaaS 平台。实时客服、代码补全、内容生成等对延迟敏感的应用将直接受益。此外,GPT-5 Turbo 还支持 streaming 输出,首 token 延迟仅 150ms。
## 行业意义
GPT-5 Turbo 的发布标志着 AI 行业的趋势转变——从追求"最大最强"到追求"最优性价比"。推理速度提升 3 倍、价格减半,这会让更多中小企业真正用得起前沿 AI。
**原文链接**: [https://openai.com/blog/gpt-5-turbo](https://openai.com/blog/gpt-5-turbo)
*来源: OpenAI*
NEWS
NVIDIA 正式发布了 Blackwell Ultra GPU,这是其下一代 AI 加速器架构,标志着 AI 计算能力的又一次飞跃。
## 规格亮点
- **制造工艺**:采用改进的 3nm 工艺,晶体管密度相比 4nm 提升 30%。芯片面积约 1000mm²,集成超过 2000 亿个晶体管。
- **算力表现**:FP8 算力达到 5 PFLOPS,相比前代 Hopper H100 提升 4 倍。FP16 算力达到 2.5 PFLOPS。
- **内存与带宽**:配备 288GB HBM4 内存,内存带宽达到 12 TB/s,相比 H100 的 3.35 TB/s 提升了 3.6 倍。
## 架构创新
Blackwell Ultra 引入了多项新架构特性:
- **第二代 Transformer Engine**:原生支持 FP4 和 FP6 精度计算,在保持模型质量的前提下进一步提升性能。
- **稀疏计算**:硬件原生支持 2:4 结构化稀疏,在不损失准确率的情况下将有效算力翻倍。
- **NVLink 6**:新的芯片间互连技术,提供 1.8 TB/s 的双向带宽,支持 576 GPU 的无阻塞全互联。
NVIDIA 表示 Blackwell Ultra 将于 2026 年第四季度开始出货,首批客户包括主要云服务提供商和大型 AI 公司。
**原文链接**: [https://nvidia.com/blackwell-ultra](https://nvidia.com/blackwell-ultra)
*来源: TechCrunch AI*
NEWS
Mistral AI 发布了 Mixtral 8x70B v2,对其 MoE(混合专家)模型进行了深度优化,展示了稀疏激活架构的持续进化潜力。
## v2 改进
- **推理效率提升 35%**:通过改进的专家路由策略,每次推理调用更少的专家,同时通过 Flash Attention 和连续批处理优化,推理延迟显著降低。
- **更好的跨专家通信**:重新设计了 Token 在专家之间的通信机制,减少通信瓶颈,在 8 GPU 推理时吞吐量提升 40%。
- **新增原生函数调用**:v2 版本原生支持函数调用和 JSON 模式输出,使其更适合 Agent 和工具使用场景。
## 开源策略
Mistral AI 继续坚持其开源策略,Mixtral 8x70B v2 以 Apache 2.0 许可证发布,包含模型权重、推理代码和微调工具。Mistral 表示开源是推动 AI 社区创新的核心方式。
**原文链接**: [https://mistral.ai/news/mixtral-8x70b-v2](https://mistral.ai/news/mixtral-8x70b-v2)
*来源: VentureBeat AI*