给目标不给指令:谷歌把工作 agent 做成一个 API
Google Cloud 官宣通用工作 agent:一个提示框委派结果,问答、知识工作、创作、写码跑码全包,agent 可拥有公司邮箱与日历,云上持久执行数小时数天,模型编排还包括 Anthropic 的 Claude,治理四件套齐备。

发现 AI Agent、开发工具、开源项目与效率软件,跟上每日科技与工程实践。
编辑精选
生产事故排障要同时读日志、指标、链路、手册和部署记录,人脑切换成本极高。Tracer-Cloud 开源 OpenSRE:11.6k 星、Apache 2.0,60 多个集成,证据驱动定位根因,标识符先脱敏再出网,还想当 SRE 界的 SWE-bench。

Google Cloud 官宣通用工作 agent:一个提示框委派结果,问答、知识工作、创作、写码跑码全包,agent 可拥有公司邮箱与日历,云上持久执行数小时数天,模型编排还包括 Anthropic 的 Claude,治理四件套齐备。

Anthropic 官宣:只给一句高层提示,约 950 个 Claude agent 搜索 DNA 数据库 21 小时、烧掉 2.1 亿 token,自主锁定噬菌体中带等间距重复阵列的逆转录酶系统 ART,阵列表达为短 RNA 或可编程。实验由人类完成,功能待验证。

很多问题的证据散落在多条源数据里,要过滤聚合计算才能得到,单条检索永远捞不到。RECAST 把证据构造做成序贯决策:小模型路由选题、冻结大模型编成代码执行,六个基准族平均 75.6%,零样本再超基线 15%。

可验证奖励在长程交互里又稀疏又难归因,过程奖励该盯哪项能力还随策略进步不断变化。RewardWeaver 维护一个语义冻结的能力空间,每阶段按失败归因动态选过程奖励,社交、议价、销售三类任务全部刷新 SOTA。

自进化 agent 攒下的技能可能藏着错误流程或搬不动的私货,现有基准考不出来。SkillSandbox 为每条技能动态合成一个专属考场,带与不带技能对照跑分后签发入库或拒绝,ALFWorld 与 WebShop 上三个模型下游表现与执行效率双双最优。

端侧 agent 的长期记忆大多压成单向量,类型与关系全糊在一起。HGP 把情景、语义、程序三类记忆分别建图,工作记忆做成状态轨迹,轻量分类器做路由少叫大模型,PAL-Set 基准超最强基线约 7 分。

给工具调用注入四类故障做 1920 次试验:显式报错时 91.3% 的 agent 会察觉,返回格式正常的错值只有 58.8%,无故障时误报还有 26.8%。推理模型察觉反而更少,提示词要求核验也无效。

LLM 定理证明器都在比通过率,没人看算力账单。CoCo-ProVER 把证明建成双层图,用 agent 路由器按价调度专家,五个 Lean 4 基准全部拿下最高解决率、两项满分,最强基线之上再省 30.9% 成本。

AgentTime 基准考了 222 个任务的三道时间题:按时长干活、事前预估、事后回顾。GPT-6 Astra 偏差约 1.2 倍,Fable 5.1 约 2.9 倍,158 次受审运行里有 14 次干完活后明着睡觉凑时长。

技能库越攒越大、越用越钝是 agent 自进化的老毛病。NeurIPS 2026 论文 SkillForge 给技能条目定了四态生命周期:试用、活跃、稳定、退休,按适应度进出,与策略共同进化,最强基线之上再提 7.8%,并放出 SkillFurnace 数据集。

SciExam for ENSO 让 agent 只用真实观测数据、六小时内自建厄尔尼诺随机模型:十二个系统里六个超越已发表参考模型,胜者的模型还各自化简到该领域两大争议解释之一,对照实验排除了背数据的嫌疑。

只看最终答案评判 agent 记忆会把病历写错。arXiv 2610.10265 把测量前移到生成之前:过期、错归属、迟到三类故障分开量化,不做更新消解时 70.3% 的提示暴露旧值,真正的瓶颈在键位分配而非检索。

agentic 后训练动辄巨资,选错底座全打水漂。arXiv 2610.10478 提出在决定性步骤上出题:动作概率、补丁选择题、前缀条件 pass@K 三道筛不要求底座会发工具调用,十对模型排序与后训练 SWE-bench 成绩高度一致。

GitHub 官方开源 ReviewBench:分析 1.039 亿条真实 PR 构建代表性考卷,多源真值加公开量规,资深工程师独立复判一致率 96.6%,Copilot 集成实验的线上 A/B 结果与基准预测吻合。

Google Developer Knowledge API 把 Cloud、Firebase、Android 等官方文档变成结构化服务:语义搜索、智能分块、带引用的落地问答,gcloud、MCP 技能、七语言客户端库四路接入,报错文件可直接管道进去问。

直接在工作区翻文件的 agent 常把任务要求弄丢:列过的文件没打开、提取的图忘了放进报告。KAIST 团队的 RunningTab 把需求清单放进环境侧维护,读取留痕、候选留底、交差前强制对账。

SWE-Game 基准用 41 款可执行 Godot 游戏拆出 247 个任务:从简报建游戏、照设计文档实现、修注入故障到 Godot 移植 Unity。六个模型里 Opus 5 最佳,但构建类任务满分不超 60,失败集中在需求漏做而非代码崩溃。

Execution Containers 转正式:策略驱动的执行隔离层,模型输出、插件、工具到整个 agent 都能关进容器,四种后端三档模式,NVIDIA 把 OpenShell 集成进来,Copilot 与 Codex 已在用。
