阿里开源Qwen3.8-Flash:提前体验下一代Qwen4架构,性价比碾压同级

Qwen3.8-Flash模型架构

阿里千问团队又放大招了!这次开源的Qwen3.8-Flash虽然名字还在3.X系列,但骨子里已经是下一代Qwen4架构的技术预览版。

简单说,就是让你提前用上了未来的技术。

核心参数一览

这是一个多模态MoE模型,总参数量125B,但每个token只激活6B,属于典型的”大力出奇迹、用小力干活”的设计。原生支持262K上下文,通过YaRN技术可以扩展到1M,长文档处理完全不是问题。

价格屠夫来了

官方定价:输入/bin/zsh.16/1M tokens,输出/bin/zsh.47/1M tokens。

对比DeepSeek V4 Flash的/bin/zsh.22//bin/zsh.66(高峰期还要翻倍),Qwen3.8-Flash的价格优势非常明显。如果实际性能达标,这对开发者和企业来说是个大利好。

技术亮点

采用了GDN QSA混合注意力、门控残差、N-gram嵌入和Muon优化器等下一代架构技术。这些名词听起来复杂,但效果很实在:

  • DeepSWE 1.1: 58.7分
  • SWE-bench Pro: 62.5分
  • CoWorkBench: 73.9分
  • AndroidWorld: 84.5分
  • MathVision: 95.7分

整体表现超越了V4 Flash,再加上这个价格,确实值得考虑换模型了。

阿里这波操作很有意思——用开源的方式让社区提前体验下一代技术,既积累了口碑,又能收集真实反馈来优化正式版。对于正在选型大模型的团队,Qwen3.8-Flash现在是个值得认真评估的选项。

本文地址:https://www.163264.com/15252

(0)
AI日报:即梦AI推影视厂牌即梦片场;DeepSeek前7月营收4.75亿元
上一篇 1天前
刘翔面临买断还是当教练的选择,王自如建议:一起干AI吧
下一篇 21小时前

相关推荐