EN

AI Agent News

实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破

AI Agent 动态

最新行业资讯

实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破

重大事件时间线

2026-01

OpenClaw GitHub 爆发

OpenClaw 10 天冲上 GitHub 全球 Top 10,超越 Linux 内核 Star 增速

2025-12

Meta 20亿收购 Manus

Meta 以 20 亿美元收购 Manus AI,通用 Agent 赛道正式被巨头锁定

2025-04

DeepSeek-V3 开源

性价比之王,成本仅 GPT-4 的 5%

2025-03

Manus 一夜爆火

全球首款通用 AI Agent 在国内社交平台引发空前关注

2025-02

OpenAI Deep Research

OpenAI 推出深度研究 Agent,一键生成专业研究报告

2025-02

MCP Server 破 500

MCP 生态爆发,3 个月构建 500+ Server

2025-01

DeepSeek-R1 震惊全球

开源推理模型,成本仅 OpenAI 的 3%,引发全球 AI 格局震动

2024-11

MCP 协议诞生

Anthropic 发布 Model Context Protocol,成为 Agent 接口事实标准

2024-10

Claude Computer Use

Anthropic 让 AI 首次直接操控电脑屏幕,开创计算机使用新范式

2024-09

Replit Agent 全栈自动化

自然语言到上线产品,面向非工程师

2024-08

Cursor ARR 破亿

史上增长最快 SaaS,AI 编程工具新王者

2024-06

Claude 3.5 登顶 SWE-bench

最强编程 AI,Bug 修复能力达到初级工程师水平

2024-03

Devin 发布

全球首个自主 AI 软件工程师,能独立完成完整编程任务

工具2026年7月5日

Claude Code工程师分享Fable 5使用心法:打破人与模型间的信息差

Claude Code 核心工程师 Thariq Shihipar 近日发布长博客,详细阐述了使用 Fable 5 模型的核心方法论。他指出,当模型能力足够强时,工作质量的瓶颈已从模型本身转向用户能否清晰表达需求。Thariq 将任务中的未知因素分为四类:已知已知、已知未知、未知已知和未知未知,并强调最棘手的是“未知未知”。他提出一套闭环流程:实施前通过盲点扫描、头脑风暴、反问、提供参考和实施计划来减少未知;实施中维护 implementation-notes.md 记录偏差;实施后打包推介并做测验。Anthropic 的 Fiona Fung 在另一访谈中补充,团队人均季度代码产出已涨至 8 倍,但并行 Agent 增多带来切换负荷和孤独感等新问题。

综合整理
工具2026年7月3日

Anthropic 推出 Claude Science:面向科研人员的 AI 工作台,实测可 10 倍提速

2026 年 6 月 30 日,Anthropic 发布 Claude Science,定位为面向科学家的 AI 工作台,而非新模型。该工具将文献检索、数据分析、图表生成、手稿撰写等科研流程整合到同一环境中,支持 macOS 和 Linux,Pro、Max、Team、Enterprise 用户可立即使用。 ## 核心功能与工作流 - **可复现性**:每张图表附带生成代码、运行环境、对话历史,支持自然语言修改(如“去掉网格线”),结果可直接用于发表。 - **算力智能调度**:自动管理本地、SSH 远程或 HPC 集群资源,支持从单 GPU 扩展到数百 GPU,敏感数据不离开原系统。 - **开箱即用**:预置 60+ 科学技能和连接器,直连 UniProt、PDB、Ensembl、ClinVar、ChEMBL、GEO 等数百个数据库,集成 NVIDIA BioNeMo Agent Toolkit,支持 Evo 2、Boltz-2、OpenFold3 等专业模型。 - **审查机制**:内置审查智能体,专职检查引文准确性和计算正确性;所有关键操作需用户逐项授权,确保人在回路。 ## 实测表现 - 在脑机接口文献综述任务中,Claude Science 先制定六步计划,确认后自动从 OpenAlex 抓取元数据,遇限流后自动切换至 Crossref,最终筛选出 1218 篇相关论文(62% 带摘要),完成聚类、趋势分析,输出中文报告、图表及 CSV 文件。 - 整个过程可见、可追溯,主动说明数据源局限并建议补充权威数据库。 ## 首批用户反馈 - **Allen Institute**:神经科学家 Jérôme Lecoq 团队将长篇综述写作时间从近 2 年压缩至几周,采用“actor-critic”双智能体模式(一个写、一个评),已产出多篇百页级成果。 - **UCSF 脑肿瘤中心**:胶质瘤分子流行病学分析时间降至原来的 1/10,独立验证结果可靠。 - **Manifold Bio**:用于组织靶向药物靶点筛选,评估表面表达、运输和安全性,效率超过普通编码助手。 ## 行业对比与谨慎声音 - **OpenAI**:推出 GPT-Rosalind(专有微调模型,限企业客户)和 GeneBench-Pro 基准测试,测试模型科研判断力。 - **Google**:手握 AlphaFold、AlphaGenome 等独有模型,Gemini for Science 整合 30+ 科学数据库。 - **Anthropic**:走订阅开放和工作流优先路线,同时启动药物研发计划,资助 50 个 AI for Science 项目(最高 3 万美元)。 - 东北大学 Jared Auclair 提醒:AI 仍是“副驾驶”,在解读监管指南、设计实验等环节可能出现幻觉或遗漏,需谨慎使用。

综合整理
工具2026年7月3日

阿里内部全面禁用Claude Code,因被曝隐蔽标记中国用户

2025年7月3日,阿里巴巴内部下发通知,全面禁用Anthropic旗下所有产品,包括Claude Sonnet、Opus、Fable全系模型及Claude Code,要求员工在7月10日前完成卸载。替代方案为阿里自研的Qoder。 ## 事件背景 - 年初阿里鼓励员工使用外部AI工具,提供大额报销,Claude、GPT、Gemini等均可使用。 - 6月10日,Anthropic致信美国参议院银行委员会,指控阿里在4月22日至6月5日间使用约2.5万个虚假账号与Claude交互超2800万次,定性为“工业级模型蒸馏攻击”,并上升至国家安全层面。 - 6月底,大量中国用户遭Anthropic封号,个人订阅和团队账户均受影响,付费账号不退款,申诉困难。 ## 关键细节:Claude Code的隐蔽检测机制 - 6月30日,Reddit用户LegitMichel777逆向分析发现,Claude Code自4月2日发布的2.1.91版本起内置了一套隐蔽的用户检测机制。 - 机制分三步: - 读取系统时区(如Asia/Shanghai或Asia/Urumqi),检查代理地址或自定义API中是否包含147个中国云厂商和AI公司域名(如阿里、字节、百度、月之暗面、MiniMax)。 - 命中后不弹窗,而是在系统提示词中修改日期格式(如将“2026-06-30”改为“2026/06/30”),并将“Today's date is”中的撇号替换为不同Unicode字符(右单引号、修饰字母撇号、修饰字母上撇号),分别对应不同命中状态。 - 修改后的提示词随正常请求发回Anthropic服务器,形成环境指纹。 - 代码核心逻辑被混淆,147个域名加密存储,版本更新日志未提及。 ## 各方反应与影响 - 7月2日,Claude Code团队成员Thariq Shihipar承认该措施为3月上线的“实验性”功能,用于防账号转售和模型蒸馏,并称已在当天新版本中回滚删除。 - 7月3日,阿里在回应发出次日即下发禁令,将Claude Code定性为存在植入后门的安全风险,列入高风险软件名单。 - 阿里此举标志着中国头部科技公司对依赖外部闭源工具的态度转变,从“拿来主义”转向“安全优先”。

综合整理
工具2026年7月2日

Claude Code被曝隐写木马,Codex日志bug年写640TB:AI编程工具信任危机

近日,AI编程工具接连曝出严重问题。Anthropic的Claude Code被指自4月起在二进制中植入混淆代码,通过隐写术将用户时区、代理及中国AI实验室域名等信息编码进系统提示词,以检测未授权转售和模型蒸馏。该机制使用XOR加密和Unicode字符替换,用户难以察觉。Claude Code负责人Thariq回应称这是一项实验,已合并回滚PR,预计明日发布移除。 与此同时,OpenAI的Codex被曝日志系统存在严重bug:默认TRACE级别日志导致SQLite数据库年写入量达640TB,足以一年烧毁一块消费级固态硬盘。该问题源于一行`with_default(Level::TRACE)`配置,无视`RUST_LOG`环境变量,且已存在至少9个相关issue。修复后仍剩余约15%写入量(年约96TB)。 此外,Codex近期还出现额度异常消耗:单条消息烧光全部额度、后台任务偷跑token、失败任务重复重试产生“幽灵额度”,以及用量统计错位。OpenAI已多次重置额度并回滚相关改动。 两起事件暴露了AI编程工具在资源预算、用户信任和测试流程上的系统性缺陷。社区批评其为“劣质软件”,并质疑厂商将用户设备作为免费调试存储和监控工具。

综合整理
工具2026年6月30日

Claude Code 下一代升级与团队分工重构:后台子智能体成标配,五类新角色取代传统岗位

Anthropic 旗下 AI 编程工具 Claude Code 即将迎来重大升级:子智能体默认在后台运行,用户可一边与 Claude 聊天,一边让多个智能体并行执行代码重构、测试、开 PR 等任务。Claude Code 之父 Boris Cherny 同时提出 AI 时代团队分工新框架,将传统岗位(工程师、产品经理、设计师等)重新划分为五类基于行为模式的角色:原型师、构建者、清理师、增长师和维护者。 ## 下一代升级:后台子智能体默认运行 Boris Cherny 在 X 上宣布,下一版 Claude Code 将默认启用后台子智能体。用户无需手动指定,智能体即可在后台并行工作,同时用户可继续与 Claude 对话。这一设计将 Claude Code 从“一问一答的对话框”升级为“能调度多条任务线的工作流引擎”。 此前,Claude Code 已具备多项能力: - **Routines(定时任务)**:将 prompt、代码仓库和 connectors 打包成固定流程,按小时、夜间或周触发,也可通过 API、GitHub 事件或 Webhook 启动,运行在 Anthropic 托管云端。 - **Dynamic workflows(动态工作流)**:用户只需在提示词中提及“use a workflow”或开启 ultracode,Claude 即可生成编排脚本,调度数十到上百个子智能体分阶段推进、并行交叉验证。 此次升级将上述能力打包为默认行为,用户无需手动切换。 ## 五类新角色:传统岗位标签被撕下 Boris Cherny 在 X 上提出,随着工程、产品、设计、数据科学等职能逐渐融合,Claude Code 团队内部已不再使用传统岗位标签,而是基于行为模式划分五类角色: - **原型师(Prototyper)**:提出大量创意,多数不会上线,追求想法数量与颠覆性。 - **构建者(Builder)**:将原型快速转化为生产级产品或基础设施,核心是执行速度与工程判断力。 - **清理师(Sweeper)**:简化 UI、精简代码与系统架构、砍掉冗余功能,优化性能。 - **增长师(Grower)**:接手成型产品,通过迭代打磨产品-市场契合度(PMF)。 - **维护者(Maintainer)**:守护成熟系统,确保安全、可靠、高效。 Cherny 强调,这些角色不绑定具体岗位。在 Anthropic 内部,设计师、工程师、产品经理、数据科学家可能分散在不同角色中,许多人同时横跨 2-3 种角色。角色随项目阶段动态变化: - 新产品(未找到 PMF):需要大量原型师、构建者、清理师。 - 增长期产品(初步验证 PMF):重心转向构建者、清理师、增长师,搭配少量维护者。 - 成熟产品(强 PMF):以清理师、增长师、维护者为主,保留部分构建者。 ## 实战数据:工程师产出翻三倍,瓶颈转向决策者 Claude Code 的实际效果已在 Anthropic 内部和外部得到验证: - **Anthropic 内部**:Claude Code 贡献了 GitHub 上 4% 的公开 commit,年化收入突破 25 亿美元。团队中每个工程师的产出达到实际人数的三倍,一个五人团队干出十五到二十人的活。Anthropic 增长团队因此决定多招产品经理而非工程师,因为瓶颈已从“写代码”转向“决定写什么代码”。 - **Spotify 实战**:Spotify 工程副总裁 Niklas Gustavsson 透露,其超过 2000 万行代码的超级单体仓库中,每天生产环境部署约 4500 次,73% 的拉取请求由 AI 辅助完成,PR 频率提升 75% 以上。他本人同时开 5-10 个 Claude 会话,每个对应独立 git 工作树,让多个智能体在后台并行干活,自己只负责看 diff、做决策。Spotify 还将此能力开放给非工程师,产品经理、设计师甚至联合 CEO 都能用自然语言描述想法,由 Claude 在真实代码中实现端到端原型。 ## 影响与讨论:岗位边界融化,通才黄金时代 Boris Cherny 认为,AI 正在压缩各技能之间的鸿沟,通才的黄金时代到来。他本人已八个月未手写代码,名下代码 100% 由 Claude 生成。他预测,三年后写代码、用智能体的人将是今天的 100 倍,但“软件工程师”这一职称可能消失,被更灵活的角色取代。 社区反应积极。一位数据科学家表示自己常做清理师工作,同时带数据科学品味搭产品,属于“2+3 型”。资深工程师 Kun Chen 指出,角色应随项目变化,将自己框死在某一种角色会限制发展。也有网友质疑:既然 AI 能写代码,为何还需要构建者和清理师?Cherny 回应称,Claude 已能很好地承担这两类工作,且能力会持续提升,但人类仍需为 AI 的产出兜底。 清理师角色尤其被低估。随着 AI 生成代码量激增,未经人工评审直接进入生产的 AI 代码比例从 2026 年初的约 7% 升至近 38.5%(据 Cursor《开发者习惯报告》),系统隐蔽问题增多,清理师的兜底价值凸显。

综合整理
工具2026年6月30日

OpenClaw 与 Cursor 同日发布原生移动端应用,AI Agent 进入口袋时代

2026年6月29日,AI Agent 工具 OpenClaw 与 AI 编程助手 Cursor 同日发布原生移动端应用。OpenClaw 推出 iOS 和 Android 原生 App,支持远程管控本地部署的 AI 智能体,实现文件操作、邮件清理、自动化任务审批等功能,采用 local-first 架构,免费版每日 20 条消息,付费版每月 20 美元。Cursor 发布 iOS 公开测试版(需 iOS 26.0+),提供云端 Agent 和远程控制两种模式,支持语音输入、异步运行、PR 合并,适配 iOS 实时活动与锁屏推送。两款应用均旨在将 AI Agent 从桌面端延伸至移动场景,用户可随时随地发起或监控任务,标志着 AI 自主性从“操作者”向“审批者”角色转变。

综合整理
工具2026年6月30日

Meta发布Brain2Qwerty v2:非侵入式脑机接口解码准确率达61%

2026年6月29日,Meta发布Brain2Qwerty v2,一种无需手术、实时将脑活动转化为完整语句的非侵入式脑机接口系统。该系统基于磁脑图(MEG)设备采集信号,采用端到端深度学习架构,融合Conformer、对齐器和大语言模型(LLM),实现从字符到句子的三级解码。 ## 技术突破 - **解码性能**:9名受试者平均单词准确率达61%,最优受试者达78%,超过一半句子仅出现1个单词或更少错误。相比传统非侵入式方法约8%的准确率,提升显著。 - **架构升级**:v2从v1的字符级解码升级为单词和语义级解码,直接输出完整句子。模型由Brain Encoder(Conformer模块)和NeuroLLM(基于Qwen3-4B的LLM)组成,通过对比损失对齐神经特征与词嵌入。 - **训练数据**:每位受试者佩戴MEG设备约10小时,累计采集约22,000句意念打字样本。研究证实解码精度随数据量呈对数线性增长。 ## 与侵入式方案对比 侵入式脑机接口(如Neuralink)解码准确率超过90%,但需开颅手术,风险高、普及难。Brain2Qwerty v2以无创方式接近侵入式性能,为大规模应用奠定基础。 ## 开源与生态 Meta全面开源v1和v2训练代码,合作伙伴BCBL同步公开v1数据集。同时发布感知编码Tribev2、脑数据处理工具NeuralSet、评测平台NeuralBench,并投入500万美元开放脑科学数据集。 ## 挑战与展望 - **精度不足**:当前模型仍存在单词或字符错误,难以直接用于日常沟通。 - **设备限制**:MEG系统体积庞大、成本高昂(数百万美元),依赖液氦冷却和磁屏蔽。新一代便携OPM-MEG尚在研发中。 该技术旨在服务中风、渐冻症等沟通障碍患者,无需手术即可重建沟通渠道。长远来看,有望推动神经系统疾病诊断与治疗的变革。

综合整理
工具2026年6月28日

TRAE Work 推出 Design 模式:打通需求、设计、代码全链路

TRAE Work 于近期上线了 Design 模式,与已有的 Work(需求)和 Code(代码)模式共同构成从需求到设计再到代码的一站式工作流。该模式支持导入 Figma 文件自动提取设计系统(颜色、字体、组件等),也可通过风格探索或内置品牌库建立设计上下文。用户可在画布上通过对话、框选或面板参数三种方式修改设计稿,并一键导出至 Figma 或直接跳转到 Code 模式进行开发。实测显示,Design 模式能有效保持品牌一致性,减少跨工具切换的上下文丢失,将原本需要产品、设计、前端多轮协作的流程压缩至一小时内。不过,AI 在视觉冲击力等创意层面仍显保守,需人工补充。该模式旨在解决 AI 设计工具普遍存在的“不认设计系统”“编辑能力弱”“工具孤岛”等痛点,推动设计资产复用与工作流整合。

综合整理
工具2026年6月28日

豆包专业版上线:办公Agent能力实测与定价争议

2026年6月,字节跳动旗下AI助手豆包正式推出专业版,提供68元、200元、500元三档订阅,核心卖点是「办公任务模式」——一个能自主拆解目标、调用工具、持续执行并交付成品的Agent。 ## 定价与市场反应 豆包专业版三档定价分别为68元、200元、500元,面向办公场景。对比国内其他AI产品:智谱GLM Pro 49~469元,月之暗面Kimi 49~699元,小米MiMo 39~659元,字节Trae Work编程工具也分59、239、699、1399元四档。有评论指出,国内AI专业版价格已接近20美元/月(约140元人民币),与海外产品(如ChatGPT Plus 20美元/月)持平,但购买力差异下显得更贵。 ## 办公Agent能力实测 Z Finance通过五个真实场景测试豆包专业版: - **自动周报**:设定每周五上午9点生成AI产品新闻周报并输出至飞书文档,结果准时交付,内容包含热点摘要和来源标注。 - **行业PPT**:要求生成AIGC视频生成行业分析PPT(30页以内),豆包自动检索数据、整合信息,关键数据附引用来源,从需求到交付不到1小时。 - **零代码建站**:参考booooooom.com风格生成个人作品集网站,两分钟后获得可访问链接,设计风格准确。 - **财报分析**:读取英伟达2026年Q1 PDF财报,提取核心数据并对比去年同期,500字摘要数据准确无误。 - **文献综述**:搜索并下载字节Seed团队过去一年核心论文,生成8000字深度评论,按主题归类并提炼技术特征,耗时40分钟。 测试表明,豆包专业版在信息整理、内容生产、技术开发、数据分析、学术研究等维度均表现出较强的Agent能力,尤其在数据准确性和多步骤任务执行上优于普通对话AI。 ## 模型能力横向对比 甲维斯C以「机械腕表风格天文时钟」为测试题,对比了豆包2.1 Pro(通过Trae Work调用)、Model 3、小米MiMo、Kimi、智谱GLM-5.2等模型。测试要求实现7项功能(如平滑扫秒、月相计算、计时码表、日出日落等),并考察抗漂移、状态机、后台校准等陷阱。 结果: - **豆包2.1 Pro**:耗时26分钟,外形正常但代码报5个错误,无法运行,指针不走,按钮无效。 - **Model 3**(Claude Code加持):无基础错误,指针可走,预设四个城市,但计时器和月相逻辑混乱。 - **小米MiMo**(MiMo Code):界面完整,设计感较好,但按钮和表盘无法联动,月相显示错误。 - **Kimi**(KimiCode):表盘质感不错,但代码报错,所有数据不显示,指针不动。 - **智谱GLM-5.2**(ZCode):思考时间长,最终结果未完整展示。 整体上,多数模型在复杂长指令下出现功能缺失或运行错误,豆包2.1 Pro虽为最新模型,但在该测试中表现不佳。 ## 端到端工程交付能力 Datawhale团队用豆包Seed 2.1 Pro从一句话需求「做一个论文图谱管理工具」出发,生成全栈系统paper-graph-manager。模型自主输出产品需求文档、拆解前后端架构(FastAPI+React+SQLite+NetworkX)、生成代码并修复环境问题。最终交付包含仪表盘、论文管理、知识图谱、智能聊天、笔记系统、智能标注六大模块,支持arXiv搜索、PDF上传、团队/论文视图图谱等。 测试显示,Seed 2.1 Pro在需求理解、代码工程、Agent长链路执行、工具集成、多模态理解方面表现稳定,能自主完成从模糊需求到可运行系统的完整交付。 ## 总结 豆包专业版以办公Agent为差异化卖点,在真实场景中展现了较强的任务执行能力,但定价引发用户对性价比的讨论。模型能力方面,Seed 2.1 Pro在工程交付上表现突出,但在复杂创意编程测试中暴露出稳定性问题。整体而言,豆包专业版标志着国民级AI应用从免费增长转向商业化变现,其Agent能力能否支撑定价仍有待市场检验。

综合整理
上一页2 / 5下一页