EN

AI Agent News

实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破

AI Agent 动态

最新行业资讯

实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破

重大事件时间线

2026-01

OpenClaw GitHub 爆发

OpenClaw 10 天冲上 GitHub 全球 Top 10,超越 Linux 内核 Star 增速

2025-12

Meta 20亿收购 Manus

Meta 以 20 亿美元收购 Manus AI,通用 Agent 赛道正式被巨头锁定

2025-04

DeepSeek-V3 开源

性价比之王,成本仅 GPT-4 的 5%

2025-03

Manus 一夜爆火

全球首款通用 AI Agent 在国内社交平台引发空前关注

2025-02

OpenAI Deep Research

OpenAI 推出深度研究 Agent,一键生成专业研究报告

2025-02

MCP Server 破 500

MCP 生态爆发,3 个月构建 500+ Server

2025-01

DeepSeek-R1 震惊全球

开源推理模型,成本仅 OpenAI 的 3%,引发全球 AI 格局震动

2024-11

MCP 协议诞生

Anthropic 发布 Model Context Protocol,成为 Agent 接口事实标准

2024-10

Claude Computer Use

Anthropic 让 AI 首次直接操控电脑屏幕,开创计算机使用新范式

2024-09

Replit Agent 全栈自动化

自然语言到上线产品,面向非工程师

2024-08

Cursor ARR 破亿

史上增长最快 SaaS,AI 编程工具新王者

2024-06

Claude 3.5 登顶 SWE-bench

最强编程 AI,Bug 修复能力达到初级工程师水平

2024-03

Devin 发布

全球首个自主 AI 软件工程师,能独立完成完整编程任务

模型2026年7月5日

华为更新韬定律论文:补充量产实测数据与工程细节,提出后摩尔时代时间缩放新范式

华为半导体业务负责人何廷波于2026年7月3日更新了τ缩放(韬定律)论文(ChinaXiv:202605.00224v2),在原有理论框架基础上大幅补充了工程细节、量产实测数据和产品规划。论文核心提出以统一特征时间常数τ作为全栈优化目标,取代传统摩尔几何缩放,覆盖从晶体管(皮秒级)到数据中心(秒级)共12个时间量级。 ## 关键更新与实测数据 - **移动SoC场景**:采用LogicFolding(逻辑折叠)技术,通过晶圆到晶圆混合键合将数字、模拟、存储电路垂直堆叠。同工艺节点下,新一代麒麟芯片相比上代平面芯片,晶体管密度从155提升至238百万颗/平方毫米(提升55%),同等性能下功耗降低41%,最大频率提升13%。 - **AI算力系统场景**:提出Unified Bus统一互联协议(跨节点延迟从几十微秒降至约100纳秒)、Hi-ONE高密度光互联引擎(每模块8Tb/s带宽,采用模拟均衡驱动而非高功耗DSP)、3D Folding(将存储/供电/光模块移至芯片表面,解决算力N²增长而带宽仅线性增长的瓶颈),预计到2035年硬件集成度提升百倍以上。 ## 技术选型与工程挑战 - **放弃顺序式3D集成**:因良率问题(高温工艺导致底层晶体管性能退化),选择更成熟的晶圆到晶圆混合键合路线。 - **散热问题首次公开**:采用热感知分区和布局,将高功耗模块在三维空间错开,但仅能缓解,尚未根治。 - **齿距比(键合层间距与顶层金属布线间距之比)** 是LogicFolding的关键参数,足够密的键合间距可实现从离散优化到连续优化的转变。 ## 产业意义 τ缩放理论为无法持续跟进顶尖光刻的厂商提供了后摩尔时代的标准化发展框架,将先进封装、片上互联、光互连提升为核心竞争力。论文基于2020年5月至2026年5月量产交付的381款芯片工程实践,从理论假说升级为具备量产佐证和清晰产业路线的完整体系。

综合整理
模型2026年7月5日

Meta研发新一代大模型Watermelon,算力投入不减反增

Meta正在研发代号为“Watermelon”(西瓜)的新一代旗舰大模型,旨在追赶OpenAI和Anthropic。据Business Insider独家报道,Meta超级智能负责人亚历山大·王在内部透露,该模型训练算力较前代Avocado提升一个数量级,在多项基准测试中已追平OpenAI的GPT-5.5。与此同时,Meta近期宣布出售闲置AI算力,引发市场对算力过剩的担忧,但随后又传出与三星签订超10万亿韩元(约合10亿美元)的2纳米AI芯片代工订单,表明其仍在加大AI基础设施投入。 ## 模型进展与性能 - Watermelon是Avocado和Muse Spark的继任者,目前处于训练阶段。 - 算力资源较前代提升一个数量级,逻辑推理、内容生成等能力显著增强。 - 在主流基准测试中,性能已与OpenAI GPT-5.5持平,跻身行业第一梯队。 ## 算力出售与市场反应 - 2025年7月1日,彭博社报道Meta计划通过“Meta Compute”项目出售闲置AI算力和模型访问权限,类似AWS Bedrock和CoreWeave模式。 - 消息公布后,Meta股价先涨后跌,7月2日下跌4.9%;美股半导体指数下跌5.44%,美光、闪迪等跌超10%。 - 市场担忧AI基建从供不应求转向阶段性过剩,但Meta后续动作显示其仍在加码。 ## 三星代工订单 - 据财联社报道,三星与Meta签署超过10万亿韩元(约合10亿美元)的AI芯片代工合同,采用2纳米工艺量产数十万组芯片。 - 该订单表明Meta并未削减算力投入,而是优化存量资产利用率。 ## 影响与解读 - Meta的双线策略:一方面出售老旧推理GPU提升资产利用率,另一方面大规模采购先进芯片训练下一代模型。 - 市场对算力过剩的恐慌可能被夸大,高端训练算力依然紧缺。 - 网友戏称Meta模型命名从Avocado到Watermelon“含水量”提升,预测下一代或为Coconut。

综合整理
模型2026年7月5日

Fable 5 回归后遭差评:安全护栏过严致跑分暴跌,开发者质疑“货不对板”

Anthropic 于 7 月 1 日重新上线其最强模型 Fable 5,但回归后迅速引发大量负面反馈。开发者普遍反映模型频繁触发安全护栏,被强制降级至性能较弱的 Opus 4.8,导致实际体验大幅下降。 ## 跑分暴跌与“降级”真相 - **BridgeMind 基准测试**显示,回归版 Fable 5 的 Debugging 能力从 86.2 跌至 25.9(跌幅 70%),Refactoring 从 73.6 跌至 38.4,Hallucination 从 75.9 跌至 61.7。 - 进一步分析发现,12 道 Debugging 题中仅 3 道由 Fable 5 完成,其余 9 道被安全分类器拦截并转给 Opus 4.8,按规则记零分。BridgeMind 指出:“模型本身未变弱,但护栏导致大部分任务无法执行。” ## 安全护栏的“误杀”与双标 - Anthropic 在官方博客中承认,新分类器“刻意设宽”,会拦截大量无害请求。用户反馈包括: - 解释“human”一词、询问“raspberry 有几个 r”等简单问题被拦截。 - 生态学博士研究“树木降温”被判定不安全,而“设计无人机蜂群”请求却顺利通过。 - 系统日志中甚至出现“TOO_DUMB_TO_NEED_FABLE”标签,暗示用户“不配使用 Fable 5”。 - 有用户发现,Fable 5 在后台思考时会输出类似“GRRR”“GAAAH”的“内心独白”,被解读为模型自身的压力反应。 ## 二次越狱与安全争议 - 回归仅两天后,安全研究员 Vitto Rivabella 宣布成功越狱 Fable 5,耗时约 20 小时,但称“直接谷歌搜索更快更便宜”。 - 越狱利用了桑塔利语等小众语言及组合攻击,但仅能获取虚假信息等“边角料”,未触及核心红线。Anthropic 将此类越狱定性为“minor”。 - 此前 Fable 5 曾因被亚马逊团队发现越狱漏洞而遭全球禁令,此次回归后 Anthropic 启动了 HackerOne 赏金计划。 ## 用户与开发者反应 - 开发者抱怨“花 Fable 5 的钱,用 Opus 4.8 的服务”。有账单显示,一次编程 session 中 75% 的工作量被转给 Opus 4.8,总费用 321 美元。 - 部分用户质疑 Fable 5 的真实性,怀疑其仅为 Opus 4.8 的“马甲”。Anthropic 回应称,模型能力未缩水,但安全边际的取舍导致误报。 - 尽管存在争议,Fable 5 在未被护栏限制时仍展现出强大能力,例如 20 分钟重建纽约市 3D 模型、173 美元生成完整游戏等。 ## 后续影响 - Anthropic 宣布 Fable 5 将于 7 月 7 日后从订阅计划中移除,改为按用量付费,但计划尽快恢复为订阅标准组件。 - 公司联合亚马逊、微软、谷歌等提出“AI 越狱严重程度评估框架”,试图建立行业安全标准。

综合整理
模型2026年7月3日

Claude Fable 5 解禁后风波不断:安全升级致性能下降,二次越狱引发争议

2026年6月30日,美国商务部正式解除对Anthropic旗下Claude Fable 5及Mythos 5的出口管制,模型于7月1日恢复全球访问。此前,6月12日因亚马逊研究团队发现越狱方法,商务部以出口管制为由要求全球下架。解禁后,Anthropic部署了新的安全分类器,但导致大量正常请求被误判降级,模型在BridgeBench等基准测试中性能大幅下滑,引发开发者强烈不满。同时,安全研究员Vitto Rivabella在7月2日宣布成功二次越狱,但指出攻击成本极高,实际收益有限。Anthropic还联合谷歌、微软、亚马逊提出行业越狱分级框架,并承诺深化政企合作。 ## 事件背景与解禁 - **封禁始末**:6月12日,美国商务部以出口管制为由,要求Anthropic对Claude Fable 5和Mythos 5实施全球下架,理由是亚马逊研究团队发现可绕过安全防护诱导生成漏洞利用代码。Anthropic因缺乏实时国籍核验手段,暂停了所有用户访问。 - **解禁条件**:6月30日,商务部长Lutnick签署解除令,Anthropic承诺主动检测安全风险、与政府合作制定发布协议、报告恶意活动。模型于7月1日恢复访问,但Mythos 5仅对部分美国机构重开。 ## 安全升级与性能争议 - **新安全分类器**:Anthropic训练了专门拦截越狱手段的分类器,拦截成功率超99%,但代价是日常编程、调试等正常请求更易被误判降级。系统在检测到风险时会自动切换至Opus 4.8,用户收到通知。 - **性能下降**:BridgeMind的BridgeBench测试显示,Fable 5回归后Debugging能力从86.2跌至25.9,Refactoring从73.6跌至38.4,Hallucination从75.9跌至61.7。12个调试任务中仅3个未触发降级,其余被强制转交Opus 4.8并记零分。 - **用户反馈**:开发者抱怨模型频繁拒绝无害请求,如解释“human”一词或统计“raspberry”中字母r的数量。有用户发现后台日志标注“TOO_DUMB_TO_NEED_FABLE”,引发对Anthropic态度的质疑。 ## 二次越狱与行业影响 - **越狱细节**:7月2日,安全研究员Vitto Rivabella宣布成功越狱,耗时20小时,利用小语种(如桑塔利语)和组合攻击绕过三层分类器。但90%的请求被拦截,最终获取的内容多为虚假信息或低危漏洞,实际价值有限。 - **行业框架**:Anthropic联合亚马逊、微软、谷歌提出四维越狱严重程度评估框架(能力增益、增益广度、武器化难度、可发现性),旨在统一风险研判标准。同时启动HackerOne漏洞披露计划,鼓励报告越狱方法。 - **政企合作**:Anthropic承诺发布前让政府机构测试模型、快速共享情报、投入算力开展联合安全研究,并设立漏洞悬赏。 ## 争议与反思 - **误判与降智**:安全分类器的过度拦截导致模型“名存实亡”,用户支付Fable 5的费用却频繁获得Opus 4.8的服务。Anthropic承认这是有意为之的取舍,但开发者认为这损害了产品价值。 - **二次越狱的启示**:尽管越狱成功,但攻击成本极高,表明当前安全措施有效提升了攻击门槛。然而,小语种等盲点暴露了AI安全训练的语料偏差问题。 - **行业影响**:事件凸显了AI安全与可用性之间的平衡难题,以及建立统一安全标准的紧迫性。Anthropic的举措可能推动行业形成更规范的越狱应对机制。

综合整理
模型2026年7月2日

无界动力发布全球首个长时序双向物理因果链隐空间世界模型MWA

具身智能初创公司无界动力(Wujie Dongli)于近日正式发布全球首个“长时序双向物理因果链”隐空间世界模型——MWA™(具身通用大脑)。该模型采用“双向动力学”架构,在统一隐空间内进行推演,并首创时序Chunk级逆向动力学建模,能够稳定规划10秒以上的长周期连续动作序列,从底层范式上解决了机器人多场景泛化与高精度执行难题。 ## 技术路线:隐空间世界模型 + 强化学习 无界动力选择“隐空间世界模型 + 强化学习”路线,区别于主流的VLA(视觉-语言-动作)模型。VLA模型依赖模仿学习,缺乏对物理因果关系的理解,泛化能力有限。MWA通过隐空间世界模型建立“世界观”,让机器人认知物理规律与因果关系;强化学习则塑造“价值观”,通过试错与奖励反馈将理解转化为精准执行策略。 ## 核心创新:潜动作与长时序双向因果链 MWA以“潜动作(Latent Action)”作为物理因果的载体,通过逆动力学编码器将画面变化转化为高维向量,摆脱了对人工动作标签的依赖,可直接利用互联网海量无标签视频进行预训练。模型采用“双向动力学”架构:逆动力学负责“由果推因”,正动力学负责“由因及果”,并通过“正逆互审机制”反复校验,提升因果推理精度。 在此基础上,MWA首创“长时序双向物理因果链”,打破传统单步瞬时推理的局限,实现时序Chunk级逆向动力学建模,能够从10秒以上的视觉序列中批量输出连续多步潜动作块(Latent Action Chunk),大幅减弱误差累积的“雪球效应”。 ## 榜单成绩与融资情况 在斯坦福大学等机构联合发起的RoboCasa GR1 TableTop榜单中,MWA以75.2%的平均任务成功率拿下全球第一,超越英伟达GR00T-N1.6等模型。公司此前已完成超2亿美元天使轮融资,Pre-A轮近2亿美元融资接近尾声,投资方包括红杉中国、线性资本、京东关联基金等。 ## 负样本数据体系AnyPhys for RL 针对行业数据集“重正轻负”的问题,无界动力首创AnyPhys负样本核心数据体系,将深层负样本、边界失稳样本、次优样本与正样本交织,构建高信息稠密性的物理边界坐标系,补齐强化学习稠密训练所需的样本维度,提升模型在真实工况中的抗干扰能力。

综合整理
模型2026年7月1日

GPT-5.6 灰度测试:用户发现隐藏“Juice值”可检测模型升级

OpenAI 于 2025 年 6 月 26 日发布 GPT-5.6 系列模型,包括旗舰 Sol、中端 Terra 和低成本 Luna,但仅限受邀合作伙伴使用。然而,48 小时后有用户发现,通过 Codex 发送特定提示词可检测模型是否已被灰度升级。该方法利用模型系统提示中的隐藏“Juice值”:GPT-5.5 在 xhigh 模式下为 768,GPT-5.6 Sol 为 128。部分用户用量面板已显示 gpt-5.6 调用记录。OpenAI 官方称预览期间 ChatGPT 不可用,但灰度测试已覆盖部分 Plus 用户。 ## 模型规格与定价 - **Sol(旗舰)**:输入 $5/百万 tokens,输出 $30/百万 tokens,上下文 150 万 tokens(较 GPT-5.5 增长 43%)。 - **Terra(中端)**:价格减半,性能接近 GPT-5.5。 - **Luna(低成本)**:输入 $1/百万 tokens,输出 $6/百万 tokens。 - 引入显式缓存断点,最低 30 分钟生命周期,缓存写入按 1.25 倍计费,读取享 90% 折扣。 - 推理侧新增 max reasoning effort 和 ultra 模式(通过子智能体协作)。 ## 性能表现 - **Terminal-Bench 2.1**:Sol Ultra 得分 91.9%,超越 GPT-5.5(88.0%)、Claude Mythos 5(84.3%)、Claude Fable 5(83.4%)、Gemini 3.1 Pro Preview(70.7%)。 - **ExploitBench**:Sol 用约三分之一的输出 tokens 达到与 Claude Mythos Preview 相当的水平。 - **网络安全**:在 OpenAI 内部测试中 Sol 得分 96.7%,跨过“High”风险阈值,但强调其更擅长发现和修复漏洞而非发起攻击。 - **GeneBench v1**:长程基因组分析中 token 效率优于 GPT-5.5。 ## 安全与访问限制 - 安全堆栈包括模型层拒绝、实时分类器、跨会话复审、按风险等级授权。 - 红队测试投入超 70 万 A100 等效 GPU 小时,配合第三方人工测试。 - 发布前已与美国政府沟通,目前仅限政府批准的合作伙伴使用。 - OpenAI 计划“未来几周内”全面开放,社区推测最快 6 月 30 日有更大规模发布。 ## 灰度检测方法 - **Juice 值测试**:在 Codex 中选择 gpt-5.5,思考强度 xhigh,发送特定 XML 提示词,若回答 128 则为 GPT-5.6 Sol,768 则为 GPT-5.5。 - **上下文窗口检测**:在 Codex CLI 运行 /status,若默认上下文显示 353k 可能已被灰度。 - **用量面板**:访问 analytics 页面查看是否有 gpt-5.6 调用记录(次日更新)。 - 注意:灰度范围不均匀,仅限 Codex,网页版 ChatGPT 暂不支持。

综合整理
模型2026年7月1日

Anthropic 的 Fable 5 和 Mythos 5 模型出口管制解除,明日恢复访问

美国商务部于 2025 年 6 月 30 日解除对 Anthropic 旗下 Claude Fable 5 和 Mythos 5 两款模型的出口管制,禁令自 6 月 12 日起持续 18 天后撤销。商务部长 Howard Lutnick 签署解除令,Anthropic 承诺主动检测安全风险、与政府合作制定未来发布协议、报告恶意活动,作为交换,模型面向外国用户不再需要许可证。Anthropic 宣布将于 7 月 1 日恢复访问。 ## 事件背景 - 6 月 12 日,美国商务部依据“视同出口”规则,禁止 Anthropic 向任何外国人(包括公司外籍员工)提供 Fable 5 和 Mythos 5,要求逐客户审批许可证。 - 禁令引发全球开发者强烈反应,依赖 Fable 5 的 AI 初创公司和独立开发者业务受阻,Vibe Coding 经济被迫暂停。 ## 解除令细节 - 解除令由商务部长 Lutnick 直接发给 Anthropic 首席算力官 Tom Brown,而非 CEO Dario Amodei。 - Anthropic 做出三项承诺: - 主动检测并处置模型安全风险; - 就协议、标准和后续发布与政府勤勉合作(涵盖未来模型); - 发现恶意活动时通报政府。 - 作为回报,Fable 5 和 Mythos 5 的出口、再出口或境内转移不再需要许可证,外国用户可自由使用。 - 美国政府保留在情况变化或 Anthropic 未兑现承诺时重新实施禁令的权利。 ## 各方反应与影响 - Anthropic 官方声明感谢用户耐心,宣布明天恢复访问。 - 知名 AI 资讯平台 BridgeMind AI 在 X 上确认解禁消息。 - 开发者社区在 Reddit 和 X 上表达兴奋,认为解禁将重启全球 AI 创新。 - 外媒爆料称,CEO Dario Amodei 因“情商不高”导致早期谈判不顺,后改派 Tom Brown 参与,谈判氛围改善并促成解禁。 ## 后续展望 - Anthropic 承诺尽快分享更新,模型面向所有普通用户开放,不限于美国。 - 事件凸显出口管制对技术创新的双刃剑效应,18 天的封锁被部分观察者视为一次“饥饿营销”,市场热情已被激活。

综合整理
模型2026年7月1日

谷歌发布Nano Banana 2 Lite与Gemini Omni Flash:4秒出图、10秒成片,轻量创作模型组合上线

2026年6月30日,谷歌DeepMind悄然上线两款轻量级AI创作模型:图像模型Nano Banana 2 Lite(代号gemini-3.1-flash-lite-image)和视频模型Gemini Omni Flash。前者主打4秒生成1K分辨率图像,成本低至0.034美元/张;后者支持对话式视频编辑,输出成本0.10美元/秒。两款模型可通过Interactions API串联,实现“文字→图像→视频”的端到端创作流水线。谷歌同步开源三个Demo应用(Anywhere、Space Lift、Omni Product Studio),展示在旅游、室内设计、电商等场景的落地潜力。 ## 模型核心能力 ### Nano Banana 2 Lite:最快最便宜的图像模型 - **速度**:约4秒生成一张1024×1024图像,是Nano Banana 2(20秒)的五分之一。 - **成本**:0.034美元/张,约为Nano Banana 2的一半、Nano Banana Pro的四分之一。 - **性能**:在Arena.ai获得Elo 1255分(报道1)或1251分(报道2),排名第五,强于初代Nano Banana Pro。 - **能力**:保持提示词遵循、角色一致性、图中文字清晰度。谷歌建议初代用户直接升级。 ### Gemini Omni Flash:对话式视频编辑模型 - **输入**:支持文本、图像、视频混合输入,输出最长10秒视频。 - **编辑**:通过自然语言进行最多三轮连续编辑,保留上下文。 - **知识**:内置Gemini世界知识,可调用历史、生物学等常识。 - **局限**:暂不支持音频参考、场景扩展;3秒内视频参考处理不完善;场景切换时角色一致性有限。 ## 价格与竞品对比 | 模型 | 价格 | 速度 | |------|------|------| | Nano Banana 2 Lite | 0.034美元/张 | 4秒 | | Nano Banana 2 | 0.067美元/张 | 4-8秒 | | Nano Banana Pro | 0.134美元/张 | 10-20秒 | | GPT Image 2(中等画质) | ~0.053美元/张 | 约3分钟 | | Omni Flash | 0.10美元/秒 | 10秒视频 | | Veo 3.1 Fast | 0.10美元/秒 | 同价 | | Sora 2 Standard(720p) | 0.10美元/秒 | 同价 | 中国厂商如字节跳动即梦、快手可灵,5秒视频定价约0.4美元,折算每秒约0.08美元,略低于Omni Flash。 ## 串联工作流与Demo应用 通过Interactions API,用户可先使用Nano Banana 2 Lite快速生成图像,再将其作为参考输入Omni Flash生成视频,并继续用自然语言修改。谷歌发布三个开源Demo: - **Anywhere**:上传自拍,Lite将人像合成到地标场景,Omni Flash转为动态视频。 - **Space Lift**:上传房间照片,Lite生成多种装修方案,Omni Flash生成空间漫游视频。 - **Omni Product Studio**:产品白底图经Lite生成场景化商品图,Omni Flash转为电商广告视频。 这些功能已集成至Gemini App、Google Flow、YouTube Shorts等产品,免费开放。 ## 社区反应与行业影响 正面评价集中在成本和效率:谷歌开发者关系团队Paige Bailey称NB2 Lite已成为默认出图工具;WPP、Figma、Adobe等企业已接入。负面反馈包括:高峰期排队超30秒、中文文字渲染错误、六指问题偶发、艺术风格迁移不稳定。部分开发者期待旗舰模型Gemini 3.5 Pro,该模型原定6月发布,据外媒报道推迟至7月,谷歌未予置评。 分析认为,谷歌此举并非“救场”,而是并行产品逻辑:旗舰模型解决能力天花板,轻量模型解决速度、成本和嵌入工作流的需求。在2026年中头部模型质量差距缩小的背景下,先进入用户工作流的模型可能更具商业优势。

综合整理
模型2026年7月1日

Anthropic 发布 Claude Sonnet 5:性能接近 Opus 4.8,价格更低,主打 Agent 能力

Anthropic 于近日正式发布 Claude Sonnet 5,定位为“迄今为止最具 Agent 属性的 Sonnet 模型”。该模型在推理、编码、工具使用和知识工作方面相比前代 Sonnet 4.6 显著提升,多项基准测试成绩接近旗舰级 Opus 4.8,但 API 价格仅为 Opus 4.8 的 60%(发布初期优惠价更低)。Sonnet 5 已全平台上线,成为 Claude Free、Pro、Max、Team、Enterprise 用户的默认模型,并支持 1M token 上下文窗口。 ## 性能表现 Sonnet 5 在多个关键基准上超越 Sonnet 4.6,逼近 Opus 4.8: - **Agentic Coding (SWE-bench Pro)**:Sonnet 5 得分 63.2%,高于 Sonnet 4.6 的 58.1%,低于 Opus 4.8 的 69.2%。 - **多学科推理 (Humanity's Last Exam)**:无工具时 Sonnet 5 为 43.2%(Sonnet 4.6 为 34.6%,Opus 4.8 为 49.8%);使用工具后提升至 57.4%,接近 Opus 4.8。 - **计算机使用 (OSWorld-Verified)**:Sonnet 5 得分 81.2%,Sonnet 4.6 为 78.5%,Opus 4.8 为 83.4%。 - **Agentic Search (BrowseComp)**:在 high/xhigh/max 档位,Sonnet 5 表现接近 Opus 4.8。 - **CursorBench 3.1**:Sonnet 5 得分 57%,Sonnet 4.6 为 49%,接近 Opus 4.8 high 档。 第三方榜单 Artificial Analysis Intelligence 显示,Sonnet 5 max 得分 53,与 GPT-5.5 high 同档,低于 Opus 4.8 high 和 GPT-5.5 xhigh。 ## 定价与成本 Sonnet 5 标准定价为每百万输入 token 3 美元、输出 15 美元;2026 年 8 月 31 日前优惠价为输入 2 美元、输出 10 美元,约为 Opus 4.8(输入 5 美元、输出 25 美元)的 40%。 实际使用成本因任务而异。例如,在构建单一 HTML 登录页面的对比测试中: - Sonnet 5:20.9k 输入 token,14.2k 输出 token,总成本 3.36 美元,耗时 2 分 11 秒。 - Opus 4.8:96.3k 输入 token,73.8k 输出 token,总成本 20.66 美元,耗时 20 分 15 秒。 但按 Cost per Intelligence Index Task 计算,Sonnet 5 max 单任务成本为 2.29 美元,高于 Opus 4.8 max 的 1.80 美元,说明实际成本受输出量、推理量等因素影响。 ## 新特性与注意事项 - **自适应思考 (Adaptive Thinking)**:取代扩展思考模式,默认中等 effort,可根据任务自动调整。 - **Tokenizer 更新**:相同文本会映射为更多 token(增幅约 1.0-1.35 倍),Anthropic 表示优惠价旨在使迁移成本大致持平。 - **速率限制上调**:为适配更高 effort 模式带来的 token 消耗,Anthropic 上调了 Chat、Cowork、Claude Code 及平台的速率限制。 - **安全评估**:Sonnet 5 在拒绝恶意请求、抵御提示注入、幻觉率和谄媚倾向方面优于 Sonnet 4.6,但失当行为率略高于 Opus 4.8 和 Mythos Preview。 ## 可用性 Sonnet 5 已全平台上线,包括 Claude 原生平台、AWS、Google Cloud、Microsoft Foundry 等。Claude Free 和 Pro 用户默认模型自动切换至 Sonnet 5,Max、Team、Enterprise 用户也可使用。开发者可通过 Claude Code 和 Claude Platform API 调用。 ## 业界反馈 早期访问合作伙伴反馈一致:Sonnet 5 比前代更具自主 Agent 能力,能完成复杂任务,且价格具有吸引力。Cursor 已宣布支持 Sonnet 5。 ## 总结 Sonnet 5 的发布标志着 Agent 能力从旗舰级模型向中端模型的迁移。对于成本敏感且需要稳定执行多步任务的团队,Sonnet 5 成为新的默认选项;而高准确率要求的任务,Opus 4.8 仍是首选。

综合整理
上一页5 / 11下一页