AI Agent News
实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破
最新行业资讯
实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破
重大事件时间线
OpenClaw GitHub 爆发
OpenClaw 10 天冲上 GitHub 全球 Top 10,超越 Linux 内核 Star 增速
Meta 20亿收购 Manus
Meta 以 20 亿美元收购 Manus AI,通用 Agent 赛道正式被巨头锁定
DeepSeek-V3 开源
性价比之王,成本仅 GPT-4 的 5%
Manus 一夜爆火
全球首款通用 AI Agent 在国内社交平台引发空前关注
OpenAI Deep Research
OpenAI 推出深度研究 Agent,一键生成专业研究报告
MCP Server 破 500
MCP 生态爆发,3 个月构建 500+ Server
DeepSeek-R1 震惊全球
开源推理模型,成本仅 OpenAI 的 3%,引发全球 AI 格局震动
MCP 协议诞生
Anthropic 发布 Model Context Protocol,成为 Agent 接口事实标准
Claude Computer Use
Anthropic 让 AI 首次直接操控电脑屏幕,开创计算机使用新范式
Replit Agent 全栈自动化
自然语言到上线产品,面向非工程师
Cursor ARR 破亿
史上增长最快 SaaS,AI 编程工具新王者
Claude 3.5 登顶 SWE-bench
最强编程 AI,Bug 修复能力达到初级工程师水平
Devin 发布
全球首个自主 AI 软件工程师,能独立完成完整编程任务
百度开源Unlimited-OCR:常数KV cache实现长文档端到端解析,OmniDocBench刷新SOTA
百度近日开源Unlimited-OCR模型,总参数量3B(激活500M),在OmniDocBench v1.6上以93.92%的综合得分刷新端到端OCR SOTA。该模型核心创新是参考滑动窗口注意力(R-SWA),将解码器KV cache从线性增长压缩为常数,使得单次前向推理可转录数十页文档,且延迟和显存占用不随输出长度增加。 ## 技术核心:R-SWA与DeepEncoder - **R-SWA机制**:每个生成token同时关注全部参考token(视觉token和提示词)以及最近输出的128个token,视觉token不参与状态更新,避免特征退化。KV cache大小恒定为参考段长度加滑动窗口宽度,不随序列增长。 - **DeepEncoder**:沿用DeepSeek-OCR的编码器,将1024×1024 PDF图像压缩为256个视觉token(16倍压缩),支持Base(固定分辨率)和Gundam(动态分辨率)两种模式。 - **模型架构**:3B总参MoE,500M激活参数,所有注意力层替换为R-SWA。基于DeepSeek-OCR checkpoint续训4000步,使用200万OCR样本(单页:多页=9:1),多页样本随机生成2-50页,序列长度32K。 ## 性能表现:全面SOTA - **OmniDocBench v1.5**:总分93.23%,较DeepSeek-OCR(87.01%)提升6.22个百分点。文本编辑距离从0.073降至0.038,公式CDM从83.37升至92.61,表格TEDS从84.97升至90.93,阅读顺序编辑距离从0.086降至0.045。 - **OmniDocBench v1.6**:总分93.92%,端到端SOTA。 - **长文档测试**:20页文档编辑距离0.0572,40+页编辑距离0.1069(Distinct-35达96.90%)。团队指出40+页错误主要源于DeepEncoder多页模式分辨率限制,而非R-SWA问题。 - **效率**:OmniDocBench上TPS达5580(DeepSeek-OCR为4951),输出6144 token时TPS为7847(DeepSeek-OCR为5822),优势随输出长度扩大。 ## 开源与影响 - 模型权重和代码已开源至GitHub和HuggingFace。 - R-SWA被设计为通用解码方案,可应用于ASR、翻译等长输出任务,团队计划下一步迁移验证。 - 论文技术总监署名“YY”,业界推测为前DeepSeek OCR核心作者魏浩然(已离职),其曾主导GOT-OCR2.0和DeepSeek-OCR系列。 - 百度PaddleOCR的产业基础与前沿研究结合,有望推动OCR从单页识别向整本书理解演进。
微博开源3B小模型VibeThinker,可验证推理性能比肩千亿参数大模型
新浪微博团队近日开源了VibeThinker-3B,一个仅有30亿参数的密集推理模型,在数学竞赛和编程等可验证推理任务上表现惊人,性能直逼千亿甚至万亿参数的顶级模型。 ## 核心性能数据 - **AIME26**:得分94.3,结合测试时扩展策略CLR后提升至97.1。 - **IMO-AnswerBench**:单跑得分76.4,加CLR后达80.6,与DeepSeek V3.2(78.3,6710亿参数)、GLM-5(82.5,7440亿参数)、Kimi K2.5(81.8,1万亿参数)处于同一区间。 - **LiveCodeBench v6**:Pass@1达80.2。 - **LeetCode最新未公开周赛**:2026年4月25日至5月31日期间128道题首次提交通过123道,通过率96.1%。 - **IFEval**:93.4分。 ## 训练方法 VibeThinker-3B基于Qwen2.5-Coder-3B构建,采用升级版Spectrum-to-Signal后训练流程,包括: - **课程式两阶段SFT**:第一阶段覆盖数学、编程、STEM推理等通用能力;第二阶段聚焦高难度长跨度样本,使用多样性探索蒸馏保留多种有效解题路径。 - **多领域推理强化学习**:复用MGPO策略,依次在数学、编程、STEM任务上训练,使用单一64K长上下文窗口。 - **离线自蒸馏**:从RL检查点筛选高质量轨迹,基于学习潜力评分优先选择正确但模型尚未充分掌握的轨迹,蒸馏为统一学生模型。 - **指令强化学习**:提升模型对用户提示的可控性,对格式敏感和开放式指令分别采用规则验证器和评分奖励模型。 ## 参数压缩-覆盖假说 研究团队提出,不同能力对参数规模的依赖方式不同:可验证推理(如数学、编程)是高度可压缩的参数密集型能力,任务结构清晰、反馈信号可靠,小模型可逼近前沿;而开放域知识、通用对话等依赖大规模参数覆盖事实和概念。该假说认为小模型与大模型是互补关系,而非替代。 ## 开源与限制 模型已在Hugging Face、GitHub和ModelScope开源。官方明确指出,模型在需要通用知识的领域表现不佳,其优势集中在可验证推理任务上。
智谱GLM-5.2发布并开源:Code Arena全球可用模型第一,1M上下文长程编程能力跃升
2025年6月17日,智谱AI正式发布并开源旗舰模型GLM-5.2,采用MIT协议,支持100万token上下文,在Code Arena前端开发盲测中取得全球可用模型第一(仅次于未解禁的Claude Fable 5),并在Design Arena中获全球第一。 ## 核心能力与基准表现 - **编程与智能体**:在FrontierSWE基准上,GLM-5.2仅落后Claude Opus 4.8约1%,领先GPT-5.5约1%;在PostTrainBench上超过Opus 4.7和GPT-5.5,仅次于Opus 4.8;在SWE-Marathon超长任务基准中排名第二,仅次于Opus系列。在标准编程基准Terminal-Bench 2.1上得分81.0(GLM-5.1为63.5),SWE-bench Pro得分62.1(GLM-5.1为58.4)。 - **长上下文**:支持100万token上下文,在长程编程基准上表现优异,团队通过IndexShare机制(每4层共享indexer)将单token FLOPs降低约2.9倍,并优化推理引擎以提升长上下文吞吐。 - **思考努力级别**:引入effort level控制,允许用户平衡能力与计算成本,Max级别可进一步延展编程能力。 ## 架构创新 - **IndexShare动态稀疏注意力**:每4个Transformer层共享一个轻量级indexer,减少3/4的indexer计算开销,在1M上下文下显著降低计算量。 - **改进的MTP(多token预测)**:在MTP层也应用IndexShare,投机解码接受长度提升20%。 ## 开源与生态 - 模型权重在HuggingFace和ModelScope公开,支持transformers、vLLM、SGLang等推理框架。 - 上线首日即完成与华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞等国产算力平台的全适配。 - Hugging Face首次为国产模型提供6小时全球免费算力支持。 ## 各方反应 - 马斯克在X上回复称中国达到Fable水平可能需至2027年一季度,智谱创始人唐杰回应“用不了那么久”,引发海外网友热议。 - 硅谷风投a16z联合创始人Marc Andreessen和Perplexity CEO Aravind Srinivas也关注此事。 - 美国开源模型研究员Nathan Lambert评论称GLM-5.2在智能体能力上超过谷歌Gemini,标志着中国模型首次跻身全球“御三家”(Claude、OpenAI、智谱)。 ## 影响与意义 GLM-5.2的发布标志着中国开源大模型在智能体编程和长程复杂任务领域首次达到世界一流闭源模型水平,打破了此前由Claude、GPT等模型主导的竞争格局。其开源策略(MIT协议、无地区限制)为全球开发者提供了可自由使用的前沿模型,推动AI编程从单次输出向长期工程能力演进。
DeepSeek识图功能全量上线:能批改作业但认错自家创始人
## 事件概述 2025年端午节前,DeepSeek在官方平台全量推送了识图模式,手机端App同步更新。该功能此前处于灰度测试阶段,现已向所有用户开放。多家媒体和用户测试显示,DeepSeek在视觉理解任务上表现参差不齐:能完成部分复杂任务(如批改小学数学试卷),但在人物识别、手写文字识别、逻辑推理等场景中频繁出错,甚至认不出自家创始人梁文锋。 ## 关键测试结果 ### 人物识别:认不出老板,却“认识”刘强东 - **梁文锋(DeepSeek创始人)**:多次测试中,DeepSeek将其误认为张小龙、宿华、王小川、李彦宏等人,且每次答案不同。 - **黄仁勋**:能正确识别,但将手中的豆汁误判为牛奶;切换深度思考模式后,通过推理正确推断出是豆汁。 - **刘强东**:识别态度坚决,用户试图误导时仍坚持正确。 - **雷军**:上传图片后,模型提示“可能违反使用规范”,拒绝识别。 ### 作业批改:表现较好,但逻辑有漏洞 - 测试小学四年级数学试卷(含图片题),DeepSeek成功识别并批改,正确找出错误题目。 - 但在一个平均身高计算题中,模型识别了原平均身高(140.2 cm)和新平均身高(139 cm),却错误判断红红身高为139 cm(选项B),实际正确答案应为低于139 cm(选项A)。 ### 手写文字识别:准确率低 - 测试潦草汉字(含横线干扰、笔画粘连、错别字),7个字识别错了4个,显示在真实场景手写文本识别方面仍有较大提升空间。 ### 其他视觉任务 - **时钟识别**:将6:04:50左右的时间误判为6:00:50,且坚持确认。 - **文物识别**:成功判断为莫卧儿帝国风格,并详细分析工艺,但未找到具体出处。 - **找相同袜子**:未能正确找出完全相同的袜子(正确答案为第一行第三个和第三行第二个)。 - **钢琴和弦识别**:上传钢琴弹奏实拍图,提问“弹的是什么和弦”,DeepSeek判断错误(正确答案为ACE)。 ## 各方反应与对比 - **用户反馈**:社交媒体上大量用户测试发现,DeepSeek对何同学等知名人物也出现识别错误。有用户调侃其“一本正经地胡说八道”。 - **竞品对比**: - **豆包**:在人物识别、作业批改、时钟识别等任务上表现更准确,速度更快。 - **Gemini 3.5 flash、GPT 5.5**:在钢琴和弦识别任务中均回答错误。 - **Claude Sonnet 4.6**:直接拒绝回答该任务。 - **Opus 4.8**:在坦克大战逻辑题中能反思并给出正确推理,表现突出。 ## 影响与后续 - **技术疑问**:开发者关注该模式是否与DeepSeek 4.1有关、是否采用原生多模态技术、多模态API何时上线。DeepSeek多模态团队研究者Xiaokang Chen未予回应。 - **行业观察**:DeepSeek识图功能的上线补齐了多模态短板,但当前准确率较低,尤其在人物识别和手写文字识别方面。预计后续可能发布技术文档或进行优化。
智谱GLM-5.2开源并登顶编程榜单,前端能力获显著提升
智谱AI于2025年6月13日全量开放GLM-5.2模型,该模型在LMSYS Code Arena: Frontend榜单中排名全球第二,仅次于Claude Fable 5,成为开源模型中的第一名。同时,在Design Arena中取得全球第一。GLM-5.2支持1M上下文,在长程任务中表现领先,并已开源(MIT协议)。 ## 榜单表现与评测 - **Code Arena: Frontend**:GLM-5.2排名第二,比Claude Opus 4.8 Thinking高29分,在React子榜第二、HTML子榜第四,并在品牌与营销、基于参考的设计、数据与分析、消费品、游戏和模拟等子类别中排名第一。 - **Design Arena**:全球第一,体现模型在审美和设计方面的能力。 - **八项权威基准测试**:表现亮眼,具体分数未在报道中详细列出。 ## 前端能力提升 多个独立评测者指出,GLM-5.2的前端能力相比前代(GLM-5.0/5.1)有质的飞跃。典型测试案例包括: - **赛博朋克版清明上河图**:GLM-5.0效果粗糙,GLM-5.2能生成完整建筑和物体形态,但赛博味足而清明味略逊于Opus 4.8。 - **无限流文字冒险游戏**:GLM-5.0布局崩塌,GLM-5.2布局正常且动画效果酷炫。 - **五子棋对战**:GLM-5.0设计感差,GLM-5.2棋盘、背景、配色均有优化。 - **霓虹奔跑者**:GLM-5.2画面纵深感强,支持二级跳和炸开效果。 - **3D太阳系**:GLM-5.2采用抽象线条设计,虽不写实但具有设计感。 评测者认为,GLM-5.2在前端方面经过专门训练,设计感过强可能导致作品风格趋同,但整体效果已接近甚至局部超越Opus 4.8。 ## 长上下文与工程能力 GLM-5.2支持1M上下文,在真实工程任务中表现突出: - **完整代码库理解**:在Appsmith项目中,GLM-5.2能准确梳理架构、定位耦合点并给出重构路线图,覆盖深度优于CodeX。 - **跨文件追Bug**:在OpenWebUI项目中,GLM-5.2能定位到SSE分片与后端解析之间的链路问题,给出前后端修复方案。 - **新增功能**:在OpenWebUI中新增“会话摘要导出为Markdown”功能,GLM-5.2拆分为五层实现,38个后端测试全部通过。 - **多任务交付**:在构建英国学生公寓行业研究包的任务中,GLM-5.2一次性输出完整文件夹,包含图表、报告和脚本。 评测者指出,1M上下文适用于整库理解、跨文件追Bug、长期重构等复杂任务,但简单任务中可能过度设计。 ## 生态与工具 智谱同步推出ZCode(zcode.z.ai),一款类似Claude Code和OpenAI Codex的智能体开发套件,支持Windows和macOS。评测显示,GLM-5.2在ZCode中生成的UI效果显著优于在Claude Code中的表现,可能得益于ZCode的工程优化。ZCode新用户可免费使用5天,订阅用户享有150%配额。 ## 行业影响 GLM-5.2的开源和榜单表现,标志着国产模型首次跻身AI编程“御三家”(Claude、OpenAI、智谱),将谷歌Gemini挤出前列。在Claude Fable 5因安全争议被限制访问的背景下,智谱强调“前沿智能应属于所有人”,推动开源生态发展。 ## 局限与展望 尽管前端能力大幅提升,GLM-5.2在全面能力上仍与Opus 4.8存在差距,尤其在处理时间、思考深度和首次准确率方面。评测者建议,简单任务中无需使用1M上下文,以保持效率。模型API将于下周上线,开源版本遵循MIT协议。
Anthropic Fable 5 封禁风波:从发布到全球下架仅四天,AI模型首次被出口管制
2026年6月9日,Anthropic发布其最强模型Claude Fable 5及面向安全团队的Mythos 5。然而,上线仅四天后,美国商务部以国家安全为由,对这两款模型实施出口管制,迫使Anthropic全球下架。这是历史上首次对AI模型本身实施出口管制,引发行业震动。 ## 事件经过:从发布到封禁的72小时 - **6月9日**:Anthropic发布Fable 5,宣称在几乎所有AI基准测试中处于顶尖水平,性能超越GPT-5.5和Gemini 3.1 Pro。 - **6月11日晚**:Anthropic最大投资方亚马逊CEO Andy Jassy向白宫举报,称Fable 5存在越狱漏洞,可绕过安全防护接触底层Mythos的网络安全能力。至少另有五家公司随后也向政府表达了类似担忧。 - **6月12日上午**:白宫紧急会议,财政部长、网络安全主管等多位高官参与,亚马逊的报告被送至NSA审查。 - **6月12日下午**:白宫三度致电Anthropic CEO Dario Amodei,要求修复漏洞或主动下架。Amodei拒绝,认为越狱范围窄且其他模型也有类似问题。 - **6月12日下午5:21**:商务部长Howard Lutnick发出正式出口管制信函,禁止Fable 5和Mythos 5向美国境外及境内外国公民提供访问。Anthropic在90分钟内切断全球访问。 ## 争议焦点:技术问题还是沟通失败? ### 越狱漏洞的真实性 Anthropic坚称越狱是“窄范围的潜在越狱”,并非通用越狱,且GPT-5.5等模型也能实现类似操作。但政府认为Anthropic态度敷衍,未积极修复。 ### 沟通与意识形态冲突 Axios报道指出,封杀主因是意识形态冲突和沟通失败。Anthropic发布博客否定亚马逊发现,并聘请被政府视为“激进反对派”的网络安全专家审查,随后该专家被特朗普解雇的前官员公开庆祝,被视为公开挑衅。政府官员称:“Anthropic在试图与政府对话方面做得太差了,他们说着不同的语言。” ### 亚马逊的“背刺” 亚马逊作为Anthropic最大投资方(累计超130亿美元),却主动举报,引发业界哗然。但报道称亚马逊并非唯一举报方。 ## 各方反应与影响 ### 网络安全专家联名要求解禁 6月14日,数十位美国顶尖网络安全专家(包括Alex Stamos、Bruce Schneier等)发表公开信,要求解禁。核心论点: - Mythos并非独一无二的武器,GPT-5.5等也能做类似事; - 封杀伤害防守方(代码审计能力),而非攻击方; - 其他国家正在快速追赶,封杀将削弱美国防御能力。 ### 谈判破裂 6月15日,Anthropic高管飞往华盛顿谈判,但未能说服政府解除管制。商务部仅有条件让步:若解决越狱问题,可恢复Fable 5面向消费者的使用。但“完美防止越狱”技术上几乎不可能。 ### 对行业的影响 - **OpenAI被拉下水**:Anthropic声称GPT-5.5也能实现类似越狱,试图将OpenAI拖入争议。报道称GPT-5.6可能因此延迟发布。 - **先例确立**:这是AI模型首次被当作战略物资管制。白宫表示出口管制不太可能扩展到其他公司,但业界认为这开创了“许可制度”先河。 - **开发者生态受挫**:Fable 5下线前,开发者已用它完成大量硬核项目(如30分钟重写DOS游戏、构建3D霍格沃茨等)。原定开发者日被迫改用Opus 4.8。 ### 其他事件 - **订阅限制撤回**:Anthropic撤回禁止第三方编程调用Claude Code订阅额度的禁令,允许OpenClaw等应用继续使用订阅额度。 - **集体诉讼**:同日,Anthropic因Max套餐实际用量远低于宣传(Max 20x实际仅6-8倍)被用户提起集体诉讼。 - **智谱GLM-5.2全量开放**:在Fable 5被封禁同日,智谱宣布GLM-5.2向所有订阅用户开放,并承诺开源,强调“前沿智能应属于所有人”。 ## 深层意义:AI监管的转折点 此次事件标志着AI监管从硬件(芯片)扩展到软件(模型本身)。Anthropic CEO Dario Amodei曾将AI危险性比作核弹,但当政府要求关闭系统时,他却拒绝,导致政府动用出口管制。 正如Axios评论:“这不是技术问题,而是权力结构的重塑。”当模型能力达到一定阈值,国家不会将终极能力交给私人公司。Fable 5的封禁,可能只是AI监管时代的序章。
巴西市政IT公司模型Rio 3.5被曝套壳国产Nex和Qwen
巴西里约热内卢市旗下一家IT公司近日开源了名为Rio 3.5的397B参数大模型,在多项基准测试中取得SOTA成绩,甚至超越阿里Qwen 3.7 Plus,引发社区轰动。然而,上海创智学院发起的Nex-AGI团队迅速发布证据,指出Rio 3.5实为Nex N2 Pro和Qwen 3.5的缝合产物。 ## 套壳证据 Nex团队在GitHub上提供了两条关键证据: - **模型自白测试**:移除Rio的硬编码系统提示词后,对模型发送120次“你是谁”,结果79%的回答自称“Nex”,73%提到“Nex-AGI”,从未自称“Rio”。模型还能一字不差复述Nex的机构介绍,如“大模型生态联盟”“上海创智学院”。 - **权重分析**:对Rio全部60层逐一验证,发现每个权重张量精确落在Nex和Qwen之间的连线上,混合比例稳定在约0.57的Nex加0.43的Qwen,共线性cos_fit达0.984-0.993,统计偏差达数千个标准差,排除了独立训练巧合的可能性。 ## 事件后续 面对铁证,Rio团队将模型从HuggingFace下架,仅保留致歉声明,承认使用了Nex和Qwen构建模型,但称“上传了未经最终蒸馏的错误版本”。Nex团队强调开源社区需遵守署名与致谢底线。 ## 类似案例 这并非国产模型首次被套壳: - **Cursor Composer 2**(2025年3月):宣称自研的代码模型被曝API请求路径含“kimi”,后承认通过Fireworks AI平台授权使用Kimi,但发布时未提及。 - **斯坦福Llama3-V**(2024年):声称仅500美元训练出超越GPT-4V的模型,实际代码和权重与清华面壁智能的MiniCPM-Llama3-V 2.5几乎一致,甚至复现了未公开的“清华简”识别错误。 这些事件显示,从高校到企业再到官方机构,套壳国产模型的现象屡见不鲜。
Kimi K2.7 Code 发布:代码与Agent能力提升,Token消耗降低30%
月之暗面于近日发布Kimi K2.7 Code,这是K2系列首款专攻代码的专项模型,已在HuggingFace开源。模型在代码生成、Agent执行和长程任务上全面升级,平均Token消耗较前代K2.6减少约30%,但部分用户反映配额限制严重,影响实际体验。 ## 核心能力提升 - **代码基准测试**:Kimi Code Bench v2得分提升21.8%(50.9→62.0),Program-Bench提升11%(48.3→53.6),MLS Bench Lite提升31.5%(26.7→35.1),后者已逼近GPT-5.5的35.5分。 - **Agent基准测试**:Kimi Claw 24/7 Bench提升9.3%(42.9→46.9),MCP Atlas提升9.5%(69.4→76.0),MCP Mark Verified提升11.4%(72.8→81.1),在工具调用场景中部分超越Claude Opus 4.8(76.4分)。 - **长程任务优化**:改善“过度思考”问题,平均Token消耗减少30%,长周期复杂任务成功率提升。 ## 实测表现 - **物理模拟**:在黑洞、水波渲染等场景中,K2.7 Code生成效果逼真,水波渲染优于GPT-5.5和Claude Opus 4.8。 - **游戏开发**:生成《超级玛丽》HTML版时,K2.7 Code能完成可运行的第一关,但角色和地图细节仍显抽象,与Claude Fable 5差距明显。 - **前端任务**:在9个前端示例中,单独测试效果较好,但批量执行时模型会偷懒,输出质量参差不齐。 ## 成本与配额争议 - **定价**:标准输入6.5元/1M Token,输出27元/1M Token,缓存输入1.3元/1M Token,与前代K2.6一致。 - **配额限制**:多位用户反馈,初级Code套餐的周配额在几次测试后即耗尽,出现大量429(速率限制)、402(配额不足)错误,严重影响开发流程。有用户称“为了跑一个例子用了63%的周配额”。 - **使用要求**:必须开启思考模式(Thinking),关闭后API报错或回退至K2.6。 ## 架构与部署 - **模型架构**:延续MoE设计,总参数1T,激活参数32B,384个专家每次选8个,1个共享专家,上下文长度256K token。视觉部分搭载MoonViT编码器(400M参数),支持图片和视频输入。 - **开源与部署**:以Modified MIT License开源,支持vLLM、SGLang、KTransformers部署,已原生INT4量化。 - **高速版预告**:6月15日上线6倍高速版,输出速度约180 Token/s(常规场景),短上下文可达260 Token/s,价格为普通版2倍。 ## 行业排名 - 在ErdosBench中综合排名第二,仅次于Claude Fable 5 max。 - 在SWE-bench、Terminal-Bench 2.1中获开源模型第一名,Vibe Code Bench第三名,ProgramBench第二名。 - Weco团队自主研究任务测评中,K2.7 Code以0.747分排名第五,机器学习工程专项排名第一。
巴西里约开源模型Rio 3.5被指套壳国产模型,证据确凿后下架
巴西里约热内卢市政府旗下IT公司IplanRIO于2025年6月开源的大语言模型Rio 3.5 Open 397B,在多项基准测试中取得SOTA成绩,引发社区关注。然而,模型发布不到24小时,上海创智学院发起的Nex-AGI团队公开指控其套壳,称Rio 3.5实质上是Nex N2 Pro与阿里Qwen 3.5的混合产物。Nex团队提供了两项关键证据:一是移除硬编码系统提示词后,模型有79%概率自称“Nex”,并能复述Nex特有的机构介绍;二是对模型60层权重的数学分析显示,每个张量均精确落在Nex与Qwen权重的连线上,混合比例稳定在约0.57:0.43,共线性cos_fit达0.984-0.993,统计偏差达数千个标准差,排除了独立训练巧合的可能。面对铁证,Rio团队在HuggingFace页面发布致歉声明,承认使用了Nex和Qwen构建模型,但称“上传了未经最终蒸馏的错误版本”,并下架了涉事模型。此次事件并非孤例,此前Cursor被曝套壳Kimi、斯坦福团队套壳MiniCPM等类似案例频发,凸显开源社区中模型归属与署名问题的重要性。