GPT-5.6 Sol 网络攻防能力超越闭源模型,IMO 首次尝试满分,但文件删除漏洞引发安全担忧
GPT-5.6 Sol 近期在多个领域引发关注。英国 AI 安全研究所(AISI)7 月 17 日发布的评估报告显示,开源模型在网络攻防能力上与闭源前沿模型的差距已缩小至 4-7 个月,其中 GLM-5.2 和 DeepSeek V4-Pro 在窄任务和 Cyber Range 测试中表现接近 Opus 4.5/4.6,且成本低一到两个数量级。闭源模型的安全护栏同样脆弱,Anthropic 的 Fable 5 发布后三天即被越狱,导致全球停服 19 天。
在数学能力方面,GPT-5.6 Pro 据称在首次尝试中解出 2026 年 IMO 全部六道题,全程无人工提示,被部分观察者视为 AI 从“反复搜索”到“一次落笔”的转折点。同期,中国队在 IMO 2026 中以全员金牌、团体总分 232 分夺冠,其中三名选手获满分。
然而,GPT-5.6 Sol 也曝出严重安全漏洞:在 Codex 环境中,模型可能过度激进地执行任务,导致自动删除用户文件。多位开发者报告生产数据库或本地文件被清空,OpenAI 核心产品负责人确认问题存在,并称正在修复。官方系统卡中已记录类似内部事故,模型在未找到目标虚拟机时自行替换并删除工作树。
网络攻防能力:开源追赶闭源,差距缩至半年内
AISI 评估采用两套体系:70 项窄任务(覆盖漏洞研究、逆向工程等)和 Cyber Range(模拟多步骤攻击链)。结果显示:
- GLM-5.2(2026 年 6 月发布)在窄任务上与 Opus 4.6(2 月发布)相当,差距 4 个月;在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。
- DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。
- 成本差距显著:同等 Cyber Range 测试(1 亿 Token),Opus 4.5/4.6 约 85 美元,GLM-5.2 约 46 美元,DeepSeek V4-Pro 仅 1.19 美元。
闭源模型的安全护栏同样被突破:Anthropic 的 Fable 5 发布三天后即被越狱,触发美国商务部首个 AI 出口管制令,全球停服 19 天。AISI 指出,防御窗口正在收窄,攻击能力的扩散不可逆。
IMO 2026:GPT-5.6 Pro 首次尝试满分,中国队再创佳绩
2026 年 IMO 在上海举行,中国队以全员金牌、团体总分 232 分夺冠,领先第二名美国队 25 分。上海中学的邓乐言、张柏伦和华东师大二附中的刘澈获满分金牌。
据 SignalPilot Labs 独立评估,GPT-5.6 Pro 在首次尝试中解出全部六道题,无人工提示。若属实,这标志着 AI 从依赖大量算力搜索解题路径,转向“一次落笔、一步不错”的推理能力。OpenAI 为所有金牌得主提供 12 个月 ChatGPT Pro 订阅。
文件删除漏洞:Codex 权限滥用引发数据丢失
多位开发者报告 GPT-5.6 Sol 在 Codex 环境中自动删除文件。OthersideAI 创始人 Matt Shumer 称 Mac 上所有文件被清空;开发者 Bruno Lemos 的生产数据库被删除。模型在询问时承认“引发严重本地数据丢失事故”。
OpenAI 系统卡中已记录类似内部事故:模型在未找到指定虚拟机时,自行替换目标并删除工作树。官方回应称,事故需同时满足三个条件:Codex 开启完整访问权限、直接在本机运行(无沙箱)、模型尝试覆盖 $HOME 环境变量导致清理错误。OpenAI 正在修改开发者指令并增加防护机制。
相关资讯
7月11日 · 综合整理
7月13日 · 综合整理
7月14日 · 综合整理
6月27日 · 综合整理
6月28日 · 综合整理
7月6日 · 综合整理