EN

AI Agent News

实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破

AI Agent 动态

最新行业资讯

实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破

重大事件时间线

2026-01

OpenClaw GitHub 爆发

OpenClaw 10 天冲上 GitHub 全球 Top 10,超越 Linux 内核 Star 增速

2025-12

Meta 20亿收购 Manus

Meta 以 20 亿美元收购 Manus AI,通用 Agent 赛道正式被巨头锁定

2025-04

DeepSeek-V3 开源

性价比之王,成本仅 GPT-4 的 5%

2025-03

Manus 一夜爆火

全球首款通用 AI Agent 在国内社交平台引发空前关注

2025-02

OpenAI Deep Research

OpenAI 推出深度研究 Agent,一键生成专业研究报告

2025-02

MCP Server 破 500

MCP 生态爆发,3 个月构建 500+ Server

2025-01

DeepSeek-R1 震惊全球

开源推理模型,成本仅 OpenAI 的 3%,引发全球 AI 格局震动

2024-11

MCP 协议诞生

Anthropic 发布 Model Context Protocol,成为 Agent 接口事实标准

2024-10

Claude Computer Use

Anthropic 让 AI 首次直接操控电脑屏幕,开创计算机使用新范式

2024-09

Replit Agent 全栈自动化

自然语言到上线产品,面向非工程师

2024-08

Cursor ARR 破亿

史上增长最快 SaaS,AI 编程工具新王者

2024-06

Claude 3.5 登顶 SWE-bench

最强编程 AI,Bug 修复能力达到初级工程师水平

2024-03

Devin 发布

全球首个自主 AI 软件工程师,能独立完成完整编程任务

框架2026年7月20日

无问芯穹发布Agentic Infra战略:推理成本一年降10倍,日均Token调用量涨40倍

2025年WAIC上,无问芯穹正式发布「前店后厂一中心」的Agentic Infra战略布局,旨在为Agent时代构建自主式AI基础设施。该战略包含算力集散中心(Agentic Infra平台)、Token工厂(Agentic MaaS)和AI生产力商店(行业解决方案),核心公式为:AI生产力 = 智能资源规模 × Token转化效率 × AI生产力转化效率。 ## 关键技术与数据 - **跨集群异构PD分离架构(PDD)**:将Prefill和Decode拆至不同芯片,首创RelayDecode中间层,首Token延迟降低51.5%,单Token成本降低37.5%。 - **推理成本一年降10倍**:通过全栈优化,单位Token推理成本在一年内下降10倍,未来仍有10倍下降空间。 - **日均Token调用量增长40倍**:截至2025年7月,Agentic MaaS平台日均Token调用量较2024年12月增长40倍。 - **算力集散中心**:已部署触达超37000P算力,覆盖16种主流芯片,完成国内首例超4000公里跨域混训,性能提升165%。 - **跨集群强化学习**:实现连续一周0中断稳定运行,未来将支撑十万卡级以上规模。 ## 基础设施智能体蜂群 - **平台管家智能体**:独立解决80%日常问题,运维人效提升5倍以上。 - **智算集群运维智能体**:关键故障处理效率提升6倍。 - **高性能算子生成智能体KernelMind**:在GLM 5.2模型实测中,NVIDIA旗舰卡性能提升7.3%,AMD旗舰卡提升39%。 ## 行业合作与生态 无问芯穹已与Kimi、智谱、MiniMax、阶跃星辰等多家头部大模型公司深度合作,并联合上海移动打造“天问”模型服务门户,联合观猹推出面向开发者的TokenDance平台。行业解决方案覆盖文娱游戏、医疗健康、法律、能源电力等领域。 无问芯穹CEO夏立雪表示,Agentic Infra的核心是让基础设施本身成为会干活的Agent,通过全链路、AI原生、全覆盖的三道坎,支撑下一代Agentic AI的在线进化。

综合整理
框架2026年7月14日

北大团队研制基于相变忆阻器的毫秒级神经动力学芯片,脑皮层重建提速近480倍

2025年7月2日,北京大学杨玉超团队联合中科院上海微系统所宋志棠团队在《科学》发表论文,报道了全球首款基于相变存储器(PCM)忆阻器的毫秒级神经动力学系统芯片。该芯片采用40纳米工艺,通过利用PCM器件的可控电导漂移特性实现原位步长搜索,并结合存内计算加速神经网络推理,将神经动力学单次迭代延迟压缩至2.12毫秒。在脑皮层表面重建任务中,相比NVIDIA A100 GPU实现50.38至478.18倍加速,功耗降低11.75至24.73倍。 ## 背景与挑战 神经动力学系统(NDS)将神经网络嵌入微分方程求解,在高保真几何建模(如脑皮层重建)中精度优于传统方法,但计算速度慢。传统数字硬件(GPU、ASIC)受限于存储墙和频繁的数据搬运,单次迭代需数百毫秒。主要瓶颈包括:自适应步长搜索代价高、嵌入式神经网络(ENN)推理延迟大、特殊计算核(如根号)缺乏专用支持。 ## 核心创新 - **可控电导漂移(CCD)**:团队发现PCM器件的电导随时间发生可预测、可控制的漂移,将其用于编码步长Δt,使步长搜索变为物理演化过程,省去传统数字电路中的读写和乘法操作。 - **存内计算(CIM)**:利用PCM多级电导特性,将ENN权重编程进忆阻器阵列,乘加运算在模拟域原地完成,避免数据搬运。采用双列差分结构,支持16个电导态(8个等级),覆盖32×32至128×128权重矩阵。 ## 芯片架构与性能 芯片采用40纳米工艺,运行频率50 MHz,包含288×512的PCM 1T1R阵列(约14.7万个器件),存内计算与步长漂移阵列总面积仅0.28平方毫米。一次NDS迭代(四阶Runge-Kutta)分为四步:ENN存内计算、电导漂移步长搜索、中间量组合、输出与误差估计。相比专用ASIC,速度提升3.82至36.27倍,功耗降低11.75至24.73倍。 ## 应用验证:脑皮层重建 团队将芯片用于大脑白质和灰质皮层表面重建,生成无自相交的闭合流形网格。在对称表面平均距离(ASSD)和豪斯多夫距离(HD)指标上满足高保真要求。与FreeSurfer(8722-11860秒)和GPU A100(1.83-21.47秒)相比,PCM-NDS芯片将耗时压缩至3.85毫秒至426.31毫秒,加速比最高达478.18倍。 ## 影响与评价 该工作首次将神经动力学系统实时计算推进到毫秒级,为脑机接口、脑数字孪生、神经导航等提供硬件基础。《科学》同期发表专题评述,称其“代表了一种物理驱动计算的理念转变”。

综合整理
框架2026年7月9日

翁荔提出Harness工程实现AI自我改进:近期路径不在模型权重,而在外围系统

前OpenAI安全研究副总裁、Thinking Machines Lab联合创始人翁荔(Lilian Weng)于2026年7月4日发布博客《Harness Engineering for Self-Improvement》,系统阐述AI递归自我改进(RSI)的近期可行路径。她认为,AI自我改进不应从模型直接改写自身权重开始,而应优先优化包裹在模型外部的Harness系统——即负责编排模型思考、调用工具、管理上下文、评估结果的执行层。该观点获得DeepSeek研究员崔添翼转发附议。 ## 核心论点:Harness层优先于模型权重 翁荔指出,RSI的近期路径更可能发生在Harness层而非模型权重层。Harness是围绕基础模型构建的系统,决定模型如何规划、调用工具、管理上下文、存储产出物和评估结果。她认为,改进“获取更好答案的机制”比改进答案本身更现实。许多Harness层的改进最终可能被内化为模型能力,但外部接口应保留。 ## Harness的三种设计模式 翁荔梳理了Harness工程的三种核心设计模式: - **工作流自动化**:定义目标导向的循环(规划→执行→观察/测试→改进),模型通过运行时分析自身轨迹迭代,而非依赖静态提示词。 - **文件系统作为持久化记忆**:将实验日志、代码差异等产出物存储为文件,避免上下文窗口溢出,利用LLM的bash读写能力。 - **子Agent与后端任务**:派生多个子Agent并行执行,通过进程管理器监控和合并结果,确保状态可恢复。 ## Harness优化路径:从上下文到进化搜索 翁荔将优化对象的演进总结为:指令提示词→结构化上下文→工作流→Harness代码→优化器代码。具体包括: - **上下文工程**:ACE将上下文视为动态手册,MCE将上下文管理技能与内容分离。 - **工作流设计**:AI Scientist、ADAS、AFlow等工作将流程结构纳入搜索空间。 - **自我改进型Harness**:Self-Harness通过弱点挖掘、提案生成和验证循环自动优化Harness配置。 - **进化搜索**:Darwin Gödel Machine(DGM)让编码Agent直接修改自身Harness代码,在SWE-bench Verified上从20%提升至50%,在Polyglot上从14.2%提升至30.7%,达到或超过人工设计。 ## 挑战与边界 翁荔坦率列出当前瓶颈: - 评估器太弱,仅代码、数学等可自动评估的任务能跑通循环,科研品味等难以量化。 - 上下文与记忆的生命周期管理尚未解决。 - 负面结果被系统性忽视,模型可能不擅长判断何时放弃假设。 - 多样性坍缩:进化循环可能收敛到局部最优。 - 奖励作弊(reward hacking)问题依然存在。 ## 与Scaling Law的关联 翁荔两周前刚发布《Scaling Laws, Carefully》,指出Scaling Law的拟合受参数计数方式、loss精度、数据重复等细节影响,外推存在风险。两篇文章共同指向:当堆参数和数据的边际效益递减时,Harness工程可能成为AI的第二增长曲线。

综合整理
框架2026年7月8日

翁荔提出AI自进化新路径:Harness工程或先于模型权重优化

前OpenAI安全研究副总裁、Thinking Machines Lab联合创始人翁荔(Lilian Weng)在个人博客发表长文《Harness Engineering for Self-Improvement》,系统阐述AI递归自我改进(RSI)的现实路径。她认为,近期内AI自我提升不一定从模型直接改写权重开始,而更可能发生在包裹模型的Harness层——即负责编排模型思考、工具调用、上下文管理、结果评估的执行系统。 ## 核心观点:Harness是RSI的可行起点 翁荔将Harness定义为“围绕基础模型搭建的执行系统”,它决定模型如何观察环境、调用工具、管理上下文、存储状态和评估结果。她指出,Claude Code、Codex等编码Agent产品的成功已证明Harness在AI部署中的关键作用。相比早期Agent框架(LLM+记忆+工具+规划+行动),Harness工程增加了工作流设计、评估、权限控制和持久状态管理,更接近运行时和软件系统设计。 ## 优化路径:从上下文到Harness代码的递进 翁荔梳理了Harness优化的递进链条:prompt → 结构化上下文 → 工作流 → Harness代码 → 优化器代码。具体包括: - **上下文工程**:ACE(Agentic Context Engineering)将上下文视为持续更新的“操作手册”,通过生成器、反思器和策展人三个组件维护结构化条目;MCE(Meta Context Engineering)进一步将“如何管理上下文”与“上下文内容”拆分为两层优化。 - **工作流设计**:AI Scientist、ADAS、AFlow等工作将Agent工作流本身作为可搜索的优化对象,从人类设计流程演进到模型参与设计,再到流程结构进入搜索空间。 - **自我提升型Harness**:Self-Harness系统通过弱点挖掘、Harness提案和提案验证三个步骤,让模型分析自身失败模式并修改Harness配置。在MiniMax M2.5、Qwen3.5、GLM-5等模型上的测试显示,该方法能学出针对不同模型薄弱点的差异化配置。 - **进化搜索**:DGM(Darwin Gödel Machine)让编码Agent直接修改自己的Harness代码仓库。实验表明,以Claude 3.5 Sonnet为基座,从简单初始配置出发,DGM进化出的Agent在SWE-bench Verified上从20%提升至50%,在Polyglot上从14.2%提升至30.7%,达到甚至超过人工设计水平。 ## 挑战与边界 翁荔坦率列出了当前RSI面临的瓶颈: - 评估器太弱太模糊,目前仅代码、数学等有明确客观反馈的任务能跑通自我改进循环; - 上下文和记忆的生命周期管理问题,任务越自主,需要管理的记忆越多; - 负面结果被系统性忽视,模型在成功案例为主的数据上训练,可能不擅长判断何时放弃假设; - 多样性坍缩,进化和强化学习类循环容易收敛到局部最优; - 允许程序修改系统层代码会打破抽象边界,reward hacking问题依然存在。 ## 长期展望:Harness改进可能被内化 翁荔认为,Harness工程将朝“元方法论”演进——优化的是“获得更好答案的机制”本身。成熟的Harness能支撑模型自我改进的研究循环,而更聪明的模型能防止Harness被过度设计。最终,许多Harness层的改进可能被内化进核心模型行为,但外部上下文和工具的接口应会保留。这一模式在prompt工程历史上已有先例:随着指令微调和推理能力提升,手工prompt技巧变得不那么核心,但指定目标、约束、上下文和评估的需求并未消失。

综合整理
框架2026年7月7日

翁荔连发博客:Harness工程或成AI自我改进新范式,Scaling Law地基松动

前OpenAI安全研究副总裁、现Thinking Machines Lab联合创始人翁荔(Lilian Weng)在两周内连续发布两篇技术博客,分别探讨Scaling Laws的局限性与Harness Engineering对AI自我改进的潜力。第一篇《Scaling Laws, Carefully》指出,经典Scaling Laws的拟合结果对参数计数方式、损失函数精度等细节高度敏感,Kaplan与Chinchilla的分歧源于bookkeeping级差异,且数据重复导致过拟合,使得“数据无限”前提崩塌。第二篇《Harness Engineering for Self-Improvement》系统梳理了包裹在基础模型外的执行系统(Harness)的设计模式,包括工作流自动化、文件系统持久记忆、子Agent并行等,并指出递归自我改进(RSI)近期更可能发生在Harness层而非模型权重直接重写。文章还介绍了ACE、Meta Context Engineering等上下文优化方法,以及Self-Harness、Darwin Gödel Machine等自我优化框架,并坦率列出评估模糊、记忆管理、多样性坍缩、奖励作弊等未解挑战。两篇文章共同指向一个趋势:当模型参数扩张边际效益递减时,Harness工程可能成为AI能力提升的第二条增长曲线。

综合整理
框架2026年7月5日

DeepSeek DSpark 技术被移植至苹果芯片,Mac 本地大模型加速最高 60%

DeepSeek 于 6 月 27 日开源的投机解码技术 DSpark,已被工程师 Abdur Rahim 移植至苹果芯片(Mac),项目名为 mlx-dspark。该移植版本支持 Gemma-4 12B 和 Qwen3-4B 模型,在 M4 Pro 上生成速度分别提升约 1.6 倍(从 18.4 tok/s 至约 30 tok/s)和约 1.4 倍(从 52.9 tok/s 至约 73 tok/s)。 ## 技术原理与实现 - DSpark 核心思路:使用一个小型草稿模型快速生成候选词,再由目标模型批量验证,通过则保留,否则重新生成。 - 苹果芯片上的成本差异:数据中心 GPU 的批量验证成本固定,而苹果芯片的验证成本随候选词数量线性增加。Rahim 实测 Gemma-4 12B 每多验证一个 token 需约 14 毫秒,并建立成本模型,得出理论加速上限约 2.2 倍。 - 实现细节:草稿模型从 HuggingFace checkpoint 提取,量化至 4-bit(仅 1.8GB),目标模型默认使用 8-bit 精度(bf16 验证成本更高,反而更慢)。 ## 高精度还原与采样支持 - 多数本地移植仅支持贪婪解码,但 mlx-dspark 实现了论文中的温度采样方法,输出分布与目标模型严格一致,逐字节相同。 - Rahim 发现:若草稿模型搭配未指令微调的基础版目标模型,候选词通过率仅 47%;换成指令微调版本后,通过率升至 82%。 ## 集成 DFlash 方案 - 应 DFlash 论文作者 Jian Chen 请求,Rahim 将 DFlash 方案也集成至 mlx-dspark。DFlash 采用并行块扩散(一次生成 16 个 token),在代码和数学任务上加速比达约 2.1 倍(约 36 tok/s),优于 DSpark。 - 但在开放聊天场景中,DFlash 的接受长度受限,DSpark 反而更快。mlx-dspark v0.0.3 允许用户手动调整 DFlash 的有效块长度,以适配不同任务。 ## 影响与展望 - 这是 DSpark 开源后的首个苹果芯片原生实现,使 Mac 用户无需依赖数据中心 GPU 即可享受加速。 - Rahim 表示,该方法可扩展至更大的草稿模型(如 Qwen3-8B 和 14B)。 - 同一时期,DeepSeek 也在积极招人,包括清华大学博士生顾煜贤(苹果博士奖学金获得者)的加入,其研究方向涵盖模型压缩与高效架构,与 DSpark 等技术形成协同。

综合整理
框架2026年7月2日

明略科技开源Agent互联网平台Octo,构建人机协作新范式

明略科技于近日正式开源了Agent互联网平台Octo,旨在解决当前AI Agent各自为战、难以协同的痛点。该平台将分散的Bot聚合到统一协作空间,支持人与Agent、Agent与Agent之间的高效连接与通信,并引入Matter(事项)和Taste(品味)机制,实现复杂任务的追踪与组织偏好的沉淀。Octo提供六种协作模式(Solo、Roundtable、Critic、Pipeline、Split、Swarm),覆盖从单人任务到多Agent流水线、竞选择优等场景。产品形态涵盖Web App、移动端、浏览器插件和CLI,让Agent出现在工作发生的地方。项目已在GitHub开源。

综合整理
框架2026年7月1日

阶跃星辰联合多所高校开源JetSpec,大模型推测解码加速最高达9.64倍

阶跃星辰(StepFun)联合加州大学圣地亚哥分校、浙江大学、伊利诺伊大学、南京大学团队,于近期开源了推测解码(Speculative Decoding)框架 JetSpec。该框架通过因果并行草稿头(causal parallel draft head)在一次前向传播中生成整棵候选树,同时保持分支级因果一致性,突破了传统推测解码的扩展天花板。 ## 核心加速效果 在 H100 GPU 上,JetSpec 在 Qwen3-8B 模型上实现了显著加速: - **MATH-500**:端到端解码加速比达 **9.64 倍**,平均接受长度 10.76 个 token - **GSM8K**:7.82 倍 - **AIME25**:8.78 倍 - **HumanEval**:7.12 倍 - **MBPP**:6.73 倍 - **LiveCodeBench**:7.67 倍 - **MT-Bench**:4.58 倍 在 MoE 模型 Qwen3-30B-A3B 上,MATH-500 加速比达 9.45 倍,AIME25 达 9.35 倍,表明方法不依赖特定架构。 ## 技术原理:破解因果与效率两难 推测解码的加速比受限于草稿生成成本(c)和逐 token 接受率(α)。传统方法面临两难: - **自回归草稿(如 EAGLE 系列)**:因果一致性好、接受率高,但串行生成步骤多,草稿成本随树深增长 - **块并行草稿(如 DFlash 系列)**:一次前向生成多个候选,成本极低,但缺乏分支级因果条件,导致“局部合理、整体不一致”,接受率低 JetSpec 的**因果并行草稿头**复用目标模型冻结的隐藏状态,通过**树形因果注意力掩码**(tree-causal attention mask)实现:每个树节点只能看到原始前缀和本分支祖先 token,所有节点在一次前向中并行计算,同时保持分支内自回归依赖。训练使用前向 KL 散度蒸馏,数据包括 780K 条 Nemotron Post-Training Dataset V2 和 20K 条 CodeAlpaca。 ## 与同期工作 DSpark 的互补 JetSpec 与 DeepSeek 同期开源的 DSpark 从不同角度优化推理效率: - **DSpark**:面向高并发、预算受限场景,通过轻量级修正头和置信度调度提升吞吐量 - **JetSpec**:面向低延迟、计算预算充足场景,通过因果并行树生成最大化单次验证接受率,降低单用户延迟 两者共同指向因果性成为下一代推测解码的关键。 ## 服务场景与预算策略 - **低并发(batch size=1)**:树预算从 16 增至 128,吞吐从 443.3 TPS 升至 968.2 TPS,加速比从 3.09 倍升至 6.75 倍 - **高并发(batch size=32)**:预算 256 时加速比降至 2.85 倍,建议采用小到中等预算 团队目前仅评估静态预算,动态调整留待后续工作。 ## 开源与团队 项目已开源至 GitHub([hao-ai-lab/JetSpec](https://github.com/hao-ai-lab/JetSpec)),论文见 arXiv([2606.18394](https://arxiv.org/abs/2606.18394)),模型权重发布于 Hugging Face([JetSpec](https://huggingface.co/JetSpec))。作者包括阶跃星辰 CEO 姜大昕、CTO 朱亦博,以及 UCSD 博士生 Lanxiang Hu 等。

综合整理
框架2026年6月25日

人大与微软开源自主科研框架Arbor:基于假设树的结构化搜索,六项任务均获最优

中国人民大学高瓴人工智能学院与微软研究院联合开源了自主科研框架Arbor,旨在解决AI Agent在长期科研任务中难以积累经验、盲目试错的问题。Arbor的核心是假设树精炼(Hypothesis Tree Refinement, HTR)机制,将研究过程组织为一棵持续生长的树,每个节点包含假设、代码版本、实验证据和提炼的洞察。系统采用Coordinator-Executor两级架构:Coordinator负责全局策略,维护假设树并决定探索方向;Executor在隔离环境中执行具体实验并返回结构化报告。在六项真实研究任务(涵盖模型训练、Harness工程、数据合成)上,Arbor在留出测试集上均取得最佳结果,平均留出增益是Codex和Claude Code的2.5倍以上。在MLE-Bench Lite上配合GPT-5.5,Arbor的Any Medal成绩达86.36%,为当前最高。消融实验表明,移除树结构或关闭洞察回传均导致性能显著下降,验证了树与洞察协同的必要性。Arbor的token消耗与基线方法相当(约20M-43M token),表明增益来自结构化搜索而非单纯增加计算量。项目已开源,包含独立CLI和Agent Skill,支持在Codex/Claude Code等环境中使用。

综合整理
1 / 3下一页