EN
返回资讯列表
模型

Qwen 3.8 Max Preview 实测:2.4万亿参数旗舰逼近闭源上限,长任务稳定性仍有差距

7月19日,阿里通义千问团队发布Qwen 3.8系列旗舰模型,总参数规模达2.4万亿(MoE架构),官方定位为全球第一梯队通用大模型,综合能力仅次于Fable 5。预览版Qwen3.8-Max-Preview已上线Token Plan、Qoder及QoderWork平台,后续将开放权重,但具体发布日期、许可证和最低部署要求尚未公布。

核心规格与升级亮点

  • 参数规模:2.4万亿总参数,较前代Qwen3.7(1.2万亿)翻倍,专家模块和预训练语料同步扩充。
  • 开放策略:旗舰模型直接开放权重,支持企业私有化部署和二次微调,打破高端闭源限制。
  • 能力提升:优化混合注意力架构,百万级长文本跨章节关联准确率提升15%以上;代码能力通过Qoder工具适配大型工程重构和多语言调试。
  • 对标竞品:与Kimi K3(2.8万亿参数)形成直接竞争,但Qwen侧重通用全场景均衡,K3主打多模态和长周期Agent。

实测表现:复杂任务能力突出,细节仍有不足

第三方评测使用与K3相同的测试集,覆盖视觉代码重构、业务逻辑可视化、建筑疏散仿真和3D魔方等任务:

  • 视觉代码重构:成功将NASA页面截图转化为单文件HTML,准确识别四层结构,使用SVG和Canvas实现离线显示,但未达到像素级复刻,窄屏适配缺失。
  • 业务驾驶舱:交付1203行单文件HTML,内嵌原生SVG图表和交互逻辑,五项核心指标与标准答案完全一致,接近内部工具原型。
  • 建筑疏散仿真:实现24×16网格、12名人员、4扇防火门等复杂规则,A*寻路路径与基准完全一致,状态维护稳定。
  • 3D魔方:从零实现可交互3D魔方,但细节未完全披露。

与K3对比及结论

  • 参数:Qwen 2.4万亿 vs K3 2.8万亿,但参数规模并非唯一决定因素。
  • 能力:Qwen在中文语义、公文翻译和企业知识库方面更成熟;K3在原生多模态和长周期Agent任务上表现更强。
  • 实测差距:Qwen在复杂UI视觉复刻和长任务稳定性上略逊于K3,首轮交付完成度约80%,但已具备扎实的工程交付能力。

总体而言,Qwen 3.8 Max Preview在复杂软件工程和工具调用任务中展现出接近顶级闭源模型的实力,但在精细设计还原和长周期约束保持上仍有提升空间。

2026年7月21日来源:综合整理

延伸阅读

想深入了解该主题,查看站内相关教程与解析。

查看相关主题