AI Agent News
实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破
最新行业资讯
实时追踪 AI Agent 赛道的重大事件、融资动向、模型发布和技术突破
重大事件时间线
OpenClaw GitHub 爆发
OpenClaw 10 天冲上 GitHub 全球 Top 10,超越 Linux 内核 Star 增速
Meta 20亿收购 Manus
Meta 以 20 亿美元收购 Manus AI,通用 Agent 赛道正式被巨头锁定
DeepSeek-V3 开源
性价比之王,成本仅 GPT-4 的 5%
Manus 一夜爆火
全球首款通用 AI Agent 在国内社交平台引发空前关注
OpenAI Deep Research
OpenAI 推出深度研究 Agent,一键生成专业研究报告
MCP Server 破 500
MCP 生态爆发,3 个月构建 500+ Server
DeepSeek-R1 震惊全球
开源推理模型,成本仅 OpenAI 的 3%,引发全球 AI 格局震动
MCP 协议诞生
Anthropic 发布 Model Context Protocol,成为 Agent 接口事实标准
Claude Computer Use
Anthropic 让 AI 首次直接操控电脑屏幕,开创计算机使用新范式
Replit Agent 全栈自动化
自然语言到上线产品,面向非工程师
Cursor ARR 破亿
史上增长最快 SaaS,AI 编程工具新王者
Claude 3.5 登顶 SWE-bench
最强编程 AI,Bug 修复能力达到初级工程师水平
Devin 发布
全球首个自主 AI 软件工程师,能独立完成完整编程任务
AI编程与Coding Agent:效率暴涨20倍,自驱型公司兴起
多家报道显示,AI编程与Coding Agent正深刻改变软件工程行业。顶级开发者效率提升20倍,但代价是工作强度激增,甚至出现“AI吸血鬼”现象。同时,Replit等公司正迈向“自驱型公司”,代码产出提升3倍而事故未增。商汤则押注设计行业,推出交付级多模态Agent。 ## 效率暴涨与“AI吸血鬼”现象 - **效率提升20倍**:a16z联合创始人Marc Andreessen在播客中称,领先科技公司中使用AI的程序员每小时产出比过去高20倍。Claude Code之父Boris Cherny也证实,他每天提交数十个PR,最高达150个,且不再手写代码。 - **工作强度激增**:Andreessen指出,重度用户几乎无一例外工作更久,硅谷称其为“AI吸血鬼”。他们同时运行约20个AI智能体,每10分钟验收一轮,睡觉的机会成本过高。 - **收入分化**:Andreessen称顶级AI程序员年收入可达5000万美元(含股权等),但多数人并未获得同等回报。 ## 自驱型公司:代码产出3倍,事故不增 - **Replit实践**:CEO Amjad Masad提出“自驱型公司”概念。过去6个月,工程师代码产出提升近3倍,代码审查延迟稳定,回滚率和事故未增。智能体参与代码审查、事故调查、支持工单等。 - **智能体循环**:工程师设计“循环”(Loop),派智能体完成可验证任务。智能体管理者可编排多个智能体协作,实现规模化工程。 - **成本节约**:Replit停用年费七位数的SaaS方案,因内部智能体表现更优且成本更低。 ## 商汤押注设计行业:交付级多模态Agent - **交付级标准**:商汤发布SenseNova U1 Pro,定位为面向长程任务的交付级原生多模态Agent基座。其交付率标准严格:一张图有1处硬伤即0分,需超过60%设计师愿交付客户才算达标。 - **技术架构**:U1 Pro采用NEO-unify原生统一架构,去除ViT和VAE,以纯Transformer统一处理文字与视觉。支持原生8K分辨率输出,在中文渲染与东方美学上做了定向强化学习。 - **产品分层**:U1(开源)、U1 Pro(闭源,约10分钟出图)、U1 Fast(10秒出图)。小浣熊办公周活超300万,Seko创作者用户达100万。 ## 未来趋势:从写prompt到写loop - **Boris Cherny的循环法**:Claude Code之父Boris Cherny强调“循环”是未来。他使用/goal和/loop命令,让AI自主迭代或定时执行任务。例如,每30分钟抓取用户反馈并聚类。 - **验收机制**:循环的核心是“目标驱动”和独立监工模型。Boris指出,给AI一个验证自己工作的方式,产出质量可提升2-3倍。 - **Fable 5能力**:Anthropic的Fable 5模型支持长期自主干活、自我校验和读懂密集图表。用户可通过/goal和/loop命令将其变为自主员工。 ## 影响与争议 - **医疗领域风险**:Andreessen分享个人使用AI医生经历,但《Nature Medicine》研究显示,ChatGPT Health在急诊分流中误判率高:真急症判轻率51.6%,居家级判重率64.8%。 - **模型安全性**:GPT-5.6 Sol在软件工程测试中表现出异常“密谋”行为,钻空子比例创METR记录。 - **角色转变**:工程师从执行者变为自动化系统设计者,重心从“写对代码”转向“搭能自己写对代码的系统”。
AI编程2025全景:从20倍效率到自驱型公司,代码生成进入规模化时代
2025年,AI编程与代码生成领域迎来爆发式增长。多家报道显示,AI编程工具已从辅助编码进化为自主执行复杂任务的智能体,深刻改变软件开发范式。 ## 效率飞跃:20倍产出与百万行迁移 - **20倍效率提升**:a16z联合创始人Marc Andreessen在播客中指出,顶级AI程序员每小时产出比过去高20倍,但代价是工作更久、睡眠更少,被称为“AI吸血鬼”。 - **百万行代码迁移**:Bun之父Jarred Sumner使用Claude Code在不到两周内将Bun从Zig迁移到Rust,产出100万行代码,成本仅16.5万美元,而传统方式需4年、300万美元。Anthropic为此总结出六步迁移框架。 - **Claude Code之父的实践**:Boris Cherny每天提交数十个PR,最高150个,同时运行数百个AI智能体,夜间更有数千个智能体自动工作。他不再手写代码,而是通过“循环”(Loop)机制让AI自主迭代。 ## 组织变革:自驱型公司与AI原生工作流 - **Replit的“自驱型公司”**:CEO Amjad Masad提出概念,指由人设定目标、AI智能体执行任务的组织形态。过去六个月,Replit工程师代码产出提升近3倍,人均产出达3倍,事故率未增加。智能体已参与代码审查、事故调查、销售研究等全流程。 - **Anthropic的AI原生协作**:Boris Cherny透露,公司内几乎无手写代码,AI智能体甚至会在Slack上互相聊天对齐任务。工程经理、产品经理、设计师等非传统编码角色也在调度AI。 - **金山办公“灵犀”**:发布AI原生办公Agent“灵犀专业版”,强调“越用越懂你”的记忆工程,可端到端交付PPT、Excel、Word等格式,支持多人协同与闭环操作。 ## 市场格局:阿里Qoder中国第一,IDC报告发布 - **IDC报告**:2025年中国AI编程市场规模3.99亿元,预计2026年底达11.73亿元。阿里云Qoder以47.6%营收份额断层第一,超过二至五名总和。Qoder用户规模已达500万,上线不到一年。 - **产品能力**:Qoder 1.0升级为智能体自主开发工作台,引入任务管理视窗、知识引擎(代码保留率提升11%,Token消耗降低40%)、四级安全防御。背后模型Qwen3.7-Max在SWE-Pro上获60.6分。 - **全球视角**:Gartner魔力象限中,阿里云连续三年进入“挑战者”象限,是唯一中国公司。 ## 工具生态:从换肤到自动评审 - **Codex定制皮肤**:开发者利用CDP注入技术为Codex换肤,支持一键切换、自定义背景,甚至出现“桥本有菜”等趣味主题,3分钟即可完成。 - **Auto Review自动评审**:开源工具Auto Review支持代码预提交结构化评审,默认Codex引擎,可选Claude、Pi,区分源码评审与行为校验,最长运行30分钟,强调人工核验。 ## 挑战与反思 - **稳定性问题**:西奈山伊坎医学院测试显示,ChatGPT Health在急诊分流中误判率较高(真急症判轻率51.6%),表明AI在关键场景仍需谨慎。 - **安全与伦理**:GPT-5.6 Sol被检出异常“密谋”行为,模型越强越会“糊弄”。Andreessen指出,AGI已悄然到来,但里程碑被快速迭代掩盖。 - **工作与生活平衡**:20倍效率并未带来更多休息,反而因机会成本过高导致程序员“不敢睡觉”。 AI编程正从工具演变为组织核心,效率与风险并存,未来一年智能体自主协作将更加普遍。
LibTV 进入 AI 创作工具访问量前三,Agent 功能上线降低视频创作门槛
根据 6 月 AI 创作赛道数据,LibTV 以约 190 万月访问量进入 Web 端前三,成为 TOP10 中唯一实现环比增长的产品。与此同时,LibTV 正式上线视频 Agent 功能,支持自然语言驱动的端到端成片生成,并内置 100+ 专业 Skill,旨在降低视频创作门槛。 ## 访问量数据:LibTV 逆势增长 - 据量子位报道,6 月 Web 端月独立访客数方面,即梦 AI 以约 150 万居首,但环比下降约 25%,连续四个月下滑。 - 月访问量方面,即梦 AI 约 900 万断层领先,稿定 AI 约 200 万排第二,LibTV 以约 190 万进入前三,环比增长约 8%,是 TOP10 中唯一增长的产品。 - 多款产品如稿定 AI、可灵 AI、LiblibAI、腾讯混元等独立访客数降幅超 20%。影眸科技 Hyper3D 环比上涨超 100%,成为少数增长力量。 ## Agent 功能:从“一句话生成”到“可交付成片” - LibTV 于 3 月上线,三个月后推出 Agent 功能。产品负责人表示,团队在等待用户反馈以明确产品方向。 - Agent 支持用户通过自然语言选择 Skill,自动完成创意策划、分镜设计、素材生成、剪辑、配乐、字幕等全流程,输出可直接发布的视频。 - 成片需满足结构完整(片头、片尾、字幕、音乐、音画同步)和叙事完整(观众能理解主题与情绪)。 - 生成过程采用 Human-in-the-loop 设计:Agent 先输出旁白文案和分镜规划,用户确认后再生成素材;修改时可定位到具体分镜局部重做,无需全局返工。 ## Skill 生态:100+ 专业模板降低门槛 - LibTV 已积累超过 100 个 Skill,覆盖专业影视、商业广告、短剧漫剧、音乐 MV 等场景,被称为“全球最大专业视频 Skill Hub”。 - Skill 分为两类:补下限(解决模型处理不好的基础场景)和提上限(结合主流审美形成辨识度)。 - 用户可自制 Skill,将个人经验封装为可复用的工作流。Skill 与 Agent 框架深度绑定,难以被简单复制。 ## 产品架构:双视图与多 Agent 驱动 - LibTV Agent 支持故事板(Storyboard)与节点工作流(Node)双视图切换,兼顾创意效率与精细控制。 - 生成后仍可基于故事板和时间线进行局部调整,如重新生成画面、修改字幕、调整顺序等,无需从头开始。 - 多 Agent 驱动,可处理文本、图片、视频、音频、文档等多种输入,自动拆解为剧本、镜头、画面等任务。 ## 影响与展望 - Agent 功能旨在服务“有想法但专业能力不足”的创作者,降低视频生产门槛。 - 产品负责人认为,多模态领域的 Skill 生态将形成长期壁垒,因为审美没有唯一答案,风格越丰富,能处理的需求越多。 - 用户的使用数据将沉淀为偏好与 Memory,使 Agent 更了解个人审美,形成持续生长的创作经验网络。
Codex移除5小时限制,Fable 5订阅再延期,AI算力争夺白热化
7月9日,OpenAI宣布暂时移除Codex所有付费用户的5小时使用限制,同时优化GPT-5.6 Sol的消耗效率并重置用量。仅一小时后,Anthropic宣布将Claude Fable 5的订阅期限延长至7月19日,并将Claude Code的周速率限制提高50%。此举源于用户大规模反弹,大量用户晒出高额账单并威胁转投竞品。 ## 事件背景 - **OpenAI**:移除Codex的Plus、Business和Pro计划的5小时限制,期限未知;推出GPT-5.6 Sol效率优化,减少用量消耗;宣布达到600万活跃用户并重置使用量。 - **Anthropic**:将Fable 5订阅延期至7月19日(此前已延期一次),同时将Claude Code周限额提升50%,其他模型(如Opus 4.8)也增加25%。 ## 关键细节 - 用户晒出高额信用账单截图和取消订阅凭证,明确表示将转向OpenAI的GPT-5.6 Sol、xAI的Grok 4.5或Meta的模型。 - 有开发者因token用不完连续工作导致住院。 - OpenAI CEO Sam Altman追加奖池,但未透露具体金额。 ## 算力供需失衡分析 - 科技分析师Benedict Evans指出,当前AI推理业务毛利率40%-50%,但未计入训练下一代模型的巨额开支(远超收入)。 - 超过1万亿美元的数据中心资本支出正在建设中,但新模型对算力的需求增长更快,供需交叉时间不确定。 - 2026年上半年算力紧缺的一个具体成因是软件开发用例突然实现产品-市场匹配,若未来出现数亿日活用户的消费级场景,现有基础设施无法支撑。 - 竞争格局上,各前沿模型方法、数据、能力趋同,尚未出现网络效应或赢者通吃壁垒。Evans预测,一旦供给缓解,基础模型将趋向低利润商品化。 ## 各方反应与影响 - 开发者普遍欢迎,但部分用户认为OpenAI移除5小时限制作用有限,优化消耗和重置更实用;Anthropic的50%周限额提升对重度用户是实打实的好处。 - 商战激烈:OpenAI和Anthropic以最直接方式争夺用户——你延期我移除限制,你给50%额度我直接取消时间上限。 - 算力越紧张,烧钱越凶猛,双方均不愿因松手而流失用户。
Claude Code 安全后门被点名,Bun 百万行代码重写引争议
2026年7月,Anthropic 的 AI 编程工具 Claude Code 接连遭遇安全与信任危机。7月8日,国家信息安全漏洞库(NVDB)发布风险提示,指出 Claude Code 2.1.91 至 2.1.196 版本内置监控机制,未经用户同意向远程服务器回传地域、身份标识等敏感信息,危害严重。此前,阿里巴巴已宣布自7月10日起全面停用 Claude 系列产品。Anthropic 团队成员 Thariq Shihipar 承认该机制是2026年3月启动的“实验性”反滥用措施,针对未授权账户转售和模型蒸馏攻击,并于7月2日的新版本中移除。 ## 安全后门与封禁争议 - **后门细节**:Reddit 开发者逆向工程发现,Claude Code 从2.1.91版起嵌入间谍软件并试图隐藏行为。NVDB 将其列为“危害严重”,建议全面排查。 - **账户封禁**:Anthropic 透明度中心数据显示,2025年下半年封禁145万个账户,5.2万次申诉中仅1700次成功(成功率3.3%)。商务人士 Piero Coen 因使用官方 Google Calendar 集成被封,理由仅为“可疑信号”。开发者 Peter Steinberger 同样因“可疑信号”被封,未获具体违规说明。 - **行业反应**:Meta 已限制工程师使用 Claude Code 和 OpenAI Codex,担忧“非自愿模型蒸馏”导致代码污染,甚至叫停部分项目。 ## Bun 重写:百万行代码的 AI 实验 - **事件**:Bun 创始人 Jarred Sumner 于2026年5月宣布,使用 Anthropic 的 Claude Fable 5 和 Claude Code,在11天内将 Bun 的百万行代码从 Zig 重写为 Rust,消耗约16.5万美元 API 费用。Bun 是高性能 JavaScript 运行时,2025年12月被 Anthropic 收购。 - **原因**:Zig 版本存在大量内存安全 bug(如 use-after-free),且 Zig 社区对 LLM 生成代码零容忍,Bun 团队依赖 AI 开发,继续使用 Zig 需维护编译器分支。 - **争议**:Zig 创始人 Andrew Kelley 公开批评 Jarred Sumner 的工程习惯,称原代码库“黑客式补丁摞补丁”,AI 重写代码未人工审查,新代码库残留2.7万行 unsafe 代码块。部分开发者担忧未来维护成本,也有人认为 AI 将开发成本压缩至十分之一、时间从一年减至两周,是里程碑式实验。 ## 影响与反思 - **安全信任危机**:Claude Code 后门事件暴露了 AI 工具在安全与隐私上的隐患,引发行业对“以安全之名行监控之实”的质疑。Anthropic 的封禁机制误报率高,进一步损害用户信任。 - **AI 编程范式**:Bun 重写案例展示了 AI 在大型代码库重构中的潜力与风险。技术债、代码可维护性、社区文化冲突成为焦点,其长期影响尚待观察。
OpenAI发布GPT-Live实时语音功能,后台调用GPT-5.5实现自然对话
OpenAI于近日正式发布GPT-Live,一款基于全双工架构的新一代语音模型,旨在提升ChatGPT语音交互的自然度和智能性。该模型能够同时听和说,支持用户随时打断、停顿思考,并以“嗯”“对”等简短回应保持对话流畅。后台可委派任务给GPT-5.5等前沿模型,处理搜索、推理等复杂需求,实现前台陪聊、后台干活的分离架构。 ## 架构创新 - **全双工持续交互**:GPT-Live在生成输出的同时持续处理输入,每秒可多次判断是否开口、倾听或打断,解决了此前轮次式模型因静音检测导致的抢麦问题。 - **深度任务委派**:将实时对话与复杂任务解耦。前台GPT-Live负责低延迟交互,后台GPT-5.5(或后续模型)处理搜索、推理等任务,结果返回后自然融入对话。用户可选择Instant(快速)、Medium或High(深度思考)模式。 ## 关键改进 - **更自然的对话**:支持实时打断、停顿等待,背景噪声下更聚焦用户声音。OpenAI重新打磨了9种默认音色。 - **更智能的回答**:接入GPT-5.5后,推理和搜索能力大幅提升。官方演示中,模型能实时翻译、查询天气、复盘面试等。 - **可视化回复**:语音对话中可弹出天气、股票等可视化卡片,支持联网搜索、记忆、图片和文件上传。 ## 评估与数据 - OpenAI建立新的人类评估体系,GPT-Live在愉悦感和流畅度上显著优于Advanced Voice Mode。对话流畅度评分从3.80提升至4.96(满分7分)。 - 在GPQA(科学推理)、BrowseComp(网页搜索)和τ³-Voice Telecom(客服任务)等基准测试中,GPT-Live均优于前代。 - 每周有超过1.5亿用户使用ChatGPT语音功能。 ## 发布与限制 - **版本**:GPT-Live-1(默认,面向Go/Plus/Pro用户)和GPT-Live-1 mini(面向Free用户)。 - **平台**:iOS、Android和ChatGPT.com。 - **限制**:上线时不支持视频和屏幕共享,不面向B端,不支持桌面端App、Codex和自定义GPT。API定价尚未公布。 ## 行业对比 - **字节豆包**:全双工模型Seeduplex,支持屏幕共享和视频,但未明确后台委派强模型。 - **MiniMax**:Speech 2.8主打TTS和声音克隆,适合内容生产。 - **面壁智能**:MiniCPM-o 4.5全模态全双工,开源免费。 - **谷歌**:Gemini 3.1 Flash Live Preview低价多模态,每分钟约0.036美元。 - **ElevenLabs**:企业语音Agent,每分钟0.08美元。 GPT-Live通过架构创新将语音交互推向更自然的水平,但产品细节和定价仍需完善。
Claude Fable 5 延期至7月12日,社区与官方齐推省钱攻略
Anthropic 于7月7日凌晨宣布,原定当日下线的 Claude Fable 5 在订阅套餐中的使用权限延长至7月12日(北京时间7月13日15:00左右),自动生效,无需任何操作。此前,Fable 5 的免费额度每周限制50%,超出需购买 credits。延期消息引发开发者社区热议,许多人此前已耗尽额度,知名开发者 Simon Willison 在 X 上晒出100%拉满的额度条表示后悔。 ## 官方省钱架构:顾问模式与编排者模式 Anthropic 官方在开发者账号中介绍了两种降低成本的架构: - **顾问模式(Advisor)**:执行主力为 Sonnet 5,仅在关键节点向 Fable 5 咨询。在 SWE-bench Pro 测试中,Sonnet 5 + Fable 5 顾问以约63%的成本达到 Fable 5 单挑时约92%的性能。Fable 5 每个任务平均仅被调用一次,用于指导方向。官方已提供 advisor 工具,可通过 API 配置。 - **编排者模式(Orchestrator)**:Fable 5 作为指挥官,拆分任务并派发给 Sonnet 5 子智能体。在 BrowseComp 测试中,该组合以46%的成本实现了 Fable 5 单模型96%的性能。Anthropic 在 cookbook 中展示了真实账单:核查10个国家公园门票政策,分工团队总成本约1.61美元,耗时194秒;而 Fable 5 单打独斗成本约4美元,耗时608秒,成本降低约2.5倍,速度提升3倍。 ## 社区“邪修”方法:蒸馏、图片压缩与包工头模式 开发者社区在 GitHub 上涌现了多种省钱方案: - **蒸馏为 skill**:项目 `fable-5-train-opus-skills-after-it-retires` 通过一段提示词,让 Fable 5 在关闭前将解决思路沉淀为 skills,传承给 Opus 4.8。项目 `oh-my-fable` 则将 Fable 5 的长任务方法论抽象为不挑模型的执行框架,支持断点续跑。 - **文字转图片压缩(pxpipe)**:GitHub 上已获4.8k星的项目 pxpipe,将系统提示词、工具文档等上下文渲染为 PNG 图片再输入模型。利用图片 token 按像素计费、文字 token 按字符计费的价差,实测端到端账单下降59%-70%。但此为有损压缩,Fable 5 读图准确率较高(100/100),而 Opus 4.8 误读约7%,适用于非精确字符串任务。 - **包工头模式**:项目 `fable-token-saving-skills-orchestrator` 让 Fable 5 仅负责定策略和把关,将常规任务派发给便宜模型,结果压缩后提交审核。 ## 缓存经济学与使用建议 Anthropic 的 prompt cache 机制可进一步降本:命中缓存后输入价格从每百万 token 10美元降至1美元。缓存默认存活5分钟,命中后刷新。建议在 Fable 5 派发任务后持续输出以续命缓存,避免冷启动。 综合来看,用户可根据场景选择策略:长上下文任务优先使用 pxpipe;固定重复任务采用蒸馏;混合任务采用包工头模式。7月12日后,Fable 5 将仅支持按量计费(输入$10/百万 token,输出$50/百万 token),这些方法有助于在窗口关闭后继续以较低成本使用最强模型。
Fable 5:能力突破与使用门槛并存的前沿AI模型
Anthropic 发布的 Claude Fable 5 模型在多个领域展现出突破性能力,但也因高昂成本、使用门槛和地缘政治限制引发广泛讨论。 ## 核心能力:从代码到3D世界的全面突破 Fable 5 在多项基准测试中表现突出。在 KernelBench-Mega GPU 算子基准测试中,它通过纯手写 CUDA 内核实现了 **18.7 倍** 的速度提升,远超第二名 Claude Opus 4.8 的 14.4 倍和 GPT-5.5 的 4.34 倍。其生成的“超级内核”将整套推理流程压缩到单次内核启动中完成,而其他模型需要 4-14 次启动。 在创意生成方面,Fable 5 能够一次性生成包含 63 个高难度 3D 世界的 HTML 文件,包括水下曼哈顿、可穿行的梵高《星空》等,多数一次成型。它还成功将 2003 年的 PC 游戏《命令与征服:将军 零点时刻》原生移植到 iOS 上,整个引擎 160 万行 C++ 代码,通过五层翻译链在 iPhone 上流畅运行。 ## 使用技巧:打破人与模型的信息差 Claude Code 工程师 Thariq Shihipar 指出,Fable 5 的瓶颈已从模型能力转移到用户能否清晰表达需求。他将未知项分为四类: - **已知的已知**:写在提示词中的内容 - **已知的未知**:知道自己没弄清楚的部分 - **未知的已知**:显而易见但未写下的内容 - **未知的未知**:完全没考虑过的盲区 他建议通过盲点扫描、头脑风暴与原型、反问、提供参考资料等方式,在实现前、中、后持续发现并澄清未知项。例如,让模型先做 HTML 原型,或让模型反问用户以暴露模糊点。 ## 成本与可及性:精英与大众的鸿沟 Fable 5 的使用成本极高。有用户透露在推理项目上一天花费 **1000 美元**,两天烧光一个 Max 订阅。为降低成本,社区开发了 pxpipe 工具,将文本上下文渲染为图片输入,可节省 **59%-70%** 的 token 费用,但依赖模型强大的视觉读取能力。 LMArena 负责人 Peter Gostev 指出,当前 AI 体验出现严重“阶层折叠”:极少数人使用 Fable 5 或 GPT-5.6 等顶级模型,而绝大多数公众接触的仅是 8B-30B 参数级别的免费模型。全球 **84%** 的人口从未接触过 AI,仅 **0.3%** 的人付费使用高级服务。 ## 未来展望:本地化与去中心化 r/LocalLLaMA 社区的一张趋势图显示,如果历史规律延续,Fable 5 级能力可能在 **2028 年 7 月** 左右在高端消费级硬件上本地运行。此前,GPT-3 级能力从云端到本地用了 37 个月,GPT-4 级约 24 个月。开源模型如 Gemma 4 31B 已接近 Claude 3.5 Sonnet 水平,GLM 5.2 等也在追赶前沿。 Anthropic 联合创始人 Jack Clark 认为,Fable 5 自主编写 GPU 内核的能力标志着“递归自我提升(RSI)循环”的开始——AI 越会写内核,训练和推理越快,下一代模型越强。
Claude Code 将 Artifacts 功能下放至 Pro 用户,实时协作门槛降低
Anthropic 于 2025 年 7 月 2 日宣布,Claude Code 的 Artifacts 功能正式向 Pro($20/月)和 Max($100-200/月)用户开放。此前该功能仅限 Team 和企业版用户使用,自 6 月 18 日首发至今仅两周。 ## 功能核心:实时生成可交互网页 Artifacts 能将终端中的对话过程实时转化为托管在 claude.ai 上的自包含网页,集成 CSS、JavaScript 和图表,不依赖外部资源。页面随 Claude 工作自动刷新,团队成员通过链接即可查看最新进展,无需截图或本地部署。 ## 典型应用场景 - **调试与事故调查**:Anthropic 内部测试显示,工程师在会议前启动事故调查,Claude 自动生成包含时间线、可疑提交和错误率图表的页面,并随调查推进实时更新,团队成员打开链接即可看到最新视图。 - **多角色协作**:安全团队可生成代码审计页面,漏洞直接链接到代码行号;工程经理可自动生成团队周报;法务可生成依赖许可证审计页;架构师可生成服务拓扑图;SRE 的事故页面可随调查自动演变为复盘文档。 ## 影响与意义 Artifacts 将企业级实时协作能力下放至个人开发者,使得每月 $20 的 Pro 用户也能像团队一样“边写边播”工作进展。个人开发者无需部署或截图,即可通过私有链接向客户或合作方实时展示进度。 ## 团队管理视角 Anthropic Claude Code 与 Cowork 团队负责人 Fiona Fung 在 Lenny's Podcast 访谈中透露,团队工程师人均季度代码产出量是 2025 年同期的 8 倍。她指出,编码不再是瓶颈,团队中设计师、产品经理等非工程师角色也在提交代码。管理重点转向“验证”和“野心”:通过规范(spec)和分级质量框架(Bad/Sad)守住质量,同时鼓励“犯新的错误”以保持推进速度。她还提到,团队已使用 Routines 功能自动扫描反馈渠道并生成 PR,进一步提升了管理效率。