模型
Qwen 3.8 Max Preview 实测:2.4万亿参数旗舰逼近闭源上限,长任务稳定性仍有差距
7月19日,阿里通义千问团队发布Qwen 3.8系列旗舰模型,总参数规模达2.4万亿(MoE架构),官方定位为全球第一梯队通用大模型,综合能力仅次于Fable 5。预览版Qwen3.8-Max-Preview已上线Token Plan、Qoder及QoderWork平台,后续将开放权重,但具体发布日期、许可证和最低部署要求尚未公布。
核心规格与升级亮点
- 参数规模:2.4万亿总参数,较前代Qwen3.7(1.2万亿)翻倍,专家模块和预训练语料同步扩充。
- 开放策略:旗舰模型直接开放权重,支持企业私有化部署和二次微调,打破高端闭源限制。
- 能力提升:优化混合注意力架构,百万级长文本跨章节关联准确率提升15%以上;代码能力通过Qoder工具适配大型工程重构和多语言调试。
- 对标竞品:与Kimi K3(2.8万亿参数)形成直接竞争,但Qwen侧重通用全场景均衡,K3主打多模态和长周期Agent。
实测表现:复杂任务能力突出,细节仍有不足
第三方评测使用与K3相同的测试集,覆盖视觉代码重构、业务逻辑可视化、建筑疏散仿真和3D魔方等任务:
- 视觉代码重构:成功将NASA页面截图转化为单文件HTML,准确识别四层结构,使用SVG和Canvas实现离线显示,但未达到像素级复刻,窄屏适配缺失。
- 业务驾驶舱:交付1203行单文件HTML,内嵌原生SVG图表和交互逻辑,五项核心指标与标准答案完全一致,接近内部工具原型。
- 建筑疏散仿真:实现24×16网格、12名人员、4扇防火门等复杂规则,A*寻路路径与基准完全一致,状态维护稳定。
- 3D魔方:从零实现可交互3D魔方,但细节未完全披露。
与K3对比及结论
- 参数:Qwen 2.4万亿 vs K3 2.8万亿,但参数规模并非唯一决定因素。
- 能力:Qwen在中文语义、公文翻译和企业知识库方面更成熟;K3在原生多模态和长周期Agent任务上表现更强。
- 实测差距:Qwen在复杂UI视觉复刻和长任务稳定性上略逊于K3,首轮交付完成度约80%,但已具备扎实的工程交付能力。
总体而言,Qwen 3.8 Max Preview在复杂软件工程和工具调用任务中展现出接近顶级闭源模型的实力,但在精细设计还原和长周期约束保持上仍有提升空间。
2026年7月21日来源:综合整理
相关资讯
中国AI模型缩小差距:DeepSeek R2与Qwen 2.5挑战西方主导地位
5月8日 · DeepSeek
Kimi K2.7 Code 发布:代码与Agent能力提升,Token消耗降低30%
6月15日 · 综合整理
腾讯混元Hy3正式版上线:推理与Agent能力提升,开源并降价
7月6日 · 综合整理
Mistral Codestral 2 登顶编程基准测试,挑战 GitHub Copilot 经济模式
4月13日 · VentureBeat AI
马斯克预测中国AI明年Q1达Fable水平,智谱唐杰回应:用不了那么久
6月19日 · 综合整理
华为更新韬定律论文:补充量产实测数据与工程细节,提出后摩尔时代时间缩放新范式
7月5日 · 综合整理