NEWS
行业动态
NEWS
OpenAI 发布了 GPT-5 Turbo,作为 GPT-5 系列的轻量高效版本,旨在为生产环境提供更具性价比的 AI 能力。 ## 核心特性 - **性能与效率**:GPT-5 Turbo 采用了改进的模型蒸馏技术,在保持 GPT-5 90% 以上性能的同时,将模型体积压缩了 60%。推理速度提升了 3 倍,首 token 延迟降低至 200ms 以下。 - **定价策略**:API 定价相比 GPT-5 降低了 50%,输入 token 价格为 $2/百万 token,输出为 $8/百万 token。这一价格使得大规模 AI 应用的经济性大大改善。 - **长上下文优化**:高效支持 128K token 上下文窗口,在长文档处理场景下的吞吐量比 GPT-5 提升了 2.5 倍。 ## 应用场景 OpenAI 表示 GPT-5 Turbo 特别针对实时应用场景进行了优化,首批用户包括…
NEWS
NVIDIA 正式发布了 Blackwell Ultra GPU,这是其下一代 AI 加速器架构,标志着 AI 计算能力的又一次飞跃。 ## 规格亮点 - **制造工艺**:采用改进的 3nm 工艺,晶体管密度相比 4nm 提升 30%。芯片面积约 1000mm²,集成超过 2000 亿个晶体管。 - **算力表现**:FP8 算力达到 5 PFLOPS,相比前代 Hopper H100 提升 4 倍。FP16 算力达到 2.5 PFLOPS。 - **内存与带宽**:配备 288GB HBM4 内存,内存带宽达到 12 TB/s,相比 H100 的 3.35 TB/s 提升了 3.6 倍。 ## 架构创新 Blackwell Ultra 引入了多项新架构特性: - **第二代 Transformer Engine**:原生支持 FP4 和 FP6 精度计算,在保持模型质量的前提下进一步提…
NEWS
Mistral AI 发布了 Mixtral 8x70B v2,对其 MoE(混合专家)模型进行了深度优化,展示了稀疏激活架构的持续进化潜力。 ## v2 改进 - **推理效率提升 35%**:通过改进的专家路由策略,每次推理调用更少的专家,同时通过 Flash Attention 和连续批处理优化,推理延迟显著降低。 - **更好的跨专家通信**:重新设计了 Token 在专家之间的通信机制,减少通信瓶颈,在 8 GPU 推理时吞吐量提升 40%。 - **新增原生函数调用**:v2 版本原生支持函数调用和 JSON 模式输出,使其更适合 Agent 和工具使用场景。 ## 开源策略 Mistral AI 继续坚持其开源策略,Mixtral 8x70B v2 以 Apache 2.0 许可证发布,包含模型权重、推理代码和微调工具。Mistral 表示开源是推动 AI 社区创新的核心方式…