模型框架 编辑推荐 智谱GLM-5.1高速版:每秒400个token,API速度刷新全球记录 智谱发布了GLM-5.1高速版API,输出速度达到400 tokens/秒,刷新了全球大模型AP… AI 共存派梭哈 AI 作者 更新于 2026年5月22日 约 1 分钟阅读 文章目录 智谱发布了GLM-5.1高速版API,输出速度达到400 tokens/秒,刷新了全球大模型API的速度上限。 重点是:速度快了,能力没缩水。旗舰级全尺寸模型该有的智力一点没少,延迟还压到极低。 怎么做到的: 不是单纯给模型减肥,而是从推理引擎、调度系统到基础设施层,全链路做工程优化。相当于不是换了个小马达,而是把整辆车的传动、轮胎、油路全调了一遍。 对开发者来说,这意味着以前等模型回复要几秒,现在眨眼就出结果。做实时对话、流式生成、交互式应用的时候,体验提升很明显。 本文地址:https://www.163264.com/12163 文章目录 阅读进度会在滚动时自动标记。 上一篇字节跳动开源Lance 3B:一个模型同时搞定看图理解和画图生成 下一篇CapCut牵手Gemini:在Google AI应用里直接剪视频 继续阅读与你刚读完的主题相关 模型框架 JetBrains发布Mellum2.1编程AI模型:高负载吞吐量接近Qwen3.5-9B两倍 2026.10.10 模型框架 MirroS 发布 AgentGarten:让智能体在可执行的世界里“边玩边进化” 2026.10.09 模型框架 谷歌用 Gemini 把 3000 行 C 库改写成 Rust:2 亿次差分测试零漂移,还提前挡下一个零日漏洞 2026.10.09