微软给 Windows 补上“本地 AI 底座”:实验性原生支持 GGUF 与 ONNX
云端的模型越来越大,端侧的诉求却越来越明确:能不能不联网、不上传数据,就在本地把 AI 跑起来?…
文章目录
云端的模型越来越大,端侧的诉求却越来越明确:能不能不联网、不上传数据,就在本地把 AI 跑起来?在这一方向上,微软为 Windows 11 补上了关键一块拼图。
一分钟速览
- 微软升级 Windows ML,实验性原生支持 GGUF 与 ONNX 格式模型推理。
- 与 llama.cpp、GGUF 开源社区合作,可从 Hugging Face 导入 GGUF 模型直接本地运行。
- 推出 Windows ML Runtime API,并配套 Text Generation API 与 Speech Recognition API。
- ONNX Runtime API 仍获完整支持,未来 Windows 优化将优先投向 Windows ML Runtime API。
端侧推理的“最后一公里”
Windows ML 是微软面向 Windows 11 的本地 AI 推理框架,开发者可在设备端运行 AI 模型,构建文本生成、语音识别等应用,并减少对特定硬件优化的依赖。此次升级后,开发者可通过 llama.cpp 的实验性集成,从 Hugging Face 导入 GGUF 模型直接在本地运行;微软还携手英伟达,向 llama.cpp 及相关性能优化贡献代码。
GGUF 是一种常用于本地运行大语言模型的模型文件格式,开发者可从 Hugging Face 等平台获取,并通过 llama.cpp 等工具在个人电脑上加载推理;ONNX 则是开放神经网络交换格式,用于在不同框架与硬件间迁移 AI 模型。新增的 Windows 原生推理路径正式名称为 Windows ML Runtime API,微软称其具备更高性能、更深系统集成与更细粒度控制能力。
为什么这件事重要
当系统级框架原生拥抱 GGUF 与 ONNX,端侧 AI 应用的开发门槛将明显下降:开发者不必再为每种硬件单独适配,模型也能更顺畅地在本地落地。对用户而言,意味着更低的延迟、更好的隐私,以及对云端依赖的减少。
趋势洞察
从“云端调用”到“系统原生本地推理”,PC 正在成为 AI 的又一阵地。微软此举,既是对苹果端侧算力路线的回应,也是在为 Windows 生态里的 AI 应用铺路。接下来值得关注的是,端侧模型与云端模型如何分工,以及这种分工会不会重新定义“个人电脑”的价值。
本文地址:https://www.163264.com/16577