AI Research
新AI智能体基准测试显示在现实任务上取得快速进展
WebArena和OSWorld基准测试显示,AI智能体在复杂的网页导航和桌面任务中完成率超过40%,仅12个月的研究进展就带来了显著提升。
2026年5月27日来源:WebArena
相关资讯
谷歌Gemini Ultra在编程基准测试中创下新纪录
5月22日 · Google AI Blog
Mistral Codestral 2 登顶编程基准测试,挑战 GitHub Copilot 经济模式
4月13日 · VentureBeat AI
OpenAI 发布 GPT-5.6 系列:旗舰 Sol 编程登顶,受限预览引争议
6月27日 · 综合整理
AI代理现已完成超过50%的真实软件任务
5月21日 · SWE-bench
自主AI代理市场预计2028年将达到280亿美元
5月24日 · Gartner
2025年企业AI代理采用调查:73%的财富500强企业已部署自主AI系统
4月17日 · McKinsey Global Institute
延伸阅读 · 相关教程
世界模型入门:从视频生成到物理推理,理解 AI 如何建模现实
厘清概念、分类与评估方法,揭示世界模型在具身智能与视频生成中的核心挑战
AI 安全实战:从提示注入到护栏工程,构建可信智能体系统
系统梳理 AI 安全风险与防护手段,助力开发者构建可靠智能体
具身智能技术栈全景:从 VLA 到世界动作模型,机器人如何学会干活
五层技术堆栈深度拆解,VLA、世界模型、触觉感知与跨本体泛化全解析
Agent 数据架构新范式:Skill + 语义层 + 知识库,让企业 Agent 真正落地
从数据架构角度出发,结合 Skill、语义层和知识库,解决 Agent 落地中的指标口径、实时数据和权限等卡点。