
阿里千问团队又放大招了!这次开源的Qwen3.8-Flash虽然名字还在3.X系列,但骨子里已经是下一代Qwen4架构的技术预览版。
简单说,就是让你提前用上了未来的技术。
核心参数一览
这是一个多模态MoE模型,总参数量125B,但每个token只激活6B,属于典型的”大力出奇迹、用小力干活”的设计。原生支持262K上下文,通过YaRN技术可以扩展到1M,长文档处理完全不是问题。
价格屠夫来了
官方定价:输入/bin/zsh.16/1M tokens,输出/bin/zsh.47/1M tokens。
对比DeepSeek V4 Flash的/bin/zsh.22//bin/zsh.66(高峰期还要翻倍),Qwen3.8-Flash的价格优势非常明显。如果实际性能达标,这对开发者和企业来说是个大利好。
技术亮点
采用了GDN QSA混合注意力、门控残差、N-gram嵌入和Muon优化器等下一代架构技术。这些名词听起来复杂,但效果很实在:
- DeepSWE 1.1: 58.7分
- SWE-bench Pro: 62.5分
- CoWorkBench: 73.9分
- AndroidWorld: 84.5分
- MathVision: 95.7分
整体表现超越了V4 Flash,再加上这个价格,确实值得考虑换模型了。
阿里这波操作很有意思——用开源的方式让社区提前体验下一代技术,既积累了口碑,又能收集真实反馈来优化正式版。对于正在选型大模型的团队,Qwen3.8-Flash现在是个值得认真评估的选项。
本文地址:https://www.163264.com/15252


微信扫一扫,鼓励一下~