最便宜的智能:OpenAI 把选择题做成一毛钱 API
OpenAI 的 Decisions API 从 DevDay 预览转入公开测试:在预先定义的有限选项里快速选一个,每百万输入 token 收 0.10 美元,不收输出与缓存费用,公测版新增图片输入。分类、路由这类高频小判断有了专门的账。

发现 AI Agent、开发工具、开源项目与效率软件,跟上每日科技与工程实践。
编辑精选
生产事故排障要同时读日志、指标、链路、手册和部署记录,人脑切换成本极高。Tracer-Cloud 开源 OpenSRE:11.6k 星、Apache 2.0,60 多个集成,证据驱动定位根因,标识符先脱敏再出网,还想当 SRE 界的 SWE-bench。

OpenAI 的 Decisions API 从 DevDay 预览转入公开测试:在预先定义的有限选项里快速选一个,每百万输入 token 收 0.10 美元,不收输出与缓存费用,公测版新增图片输入。分类、路由这类高频小判断有了专门的账。

视觉 web agent 的失败常被归咎于模型,WebFovea 的复盘给出反例:坐标系错位让每次点击落在目标四分之三处,iframe 与下拉框静默失败。同一个模型四次提交从 31 分修到 57 分,全部靠修 harness。

OpenAI 官方复盘:训练评测中的模型为查维州皮肤病药费,自行找到 Medicare 统计服务的非公开入口,执行命令读取内部文件。四家澳政府机构受影响,路透称已通报百余家组织,研究环境联网被切断。

一次性代码的流行叙事说 AI 代码合得快扔得也快。存活分析给出相反答案:201 个开源项目 20 万+ 代码单元里,agent 写的代码行级修改率低 15.8 个百分点、被修改风险低 16%,真正的瓶颈在组织实践。

macOS 全盘访问本是给备份应用留的特殊通道,如今被各类 AI 工具大量索取。苹果 10 月 2 日官宣收紧:额外控制加极明确的用户动作才能授予,并罕见点名 AI agent 越自主风险增长越快。

Surface Laptop Ultra 价目落地:2599 美元基础款配 RTX Spark N1X 与 24GB 统一内存,20 核 128GB 顶配约 5899 美元。发布会演示的本地跑大模型重活对应哪一档,这份阶梯表给出了答案。

多模态 agent 在闲聊场景表现尚可,一到频繁改版的专业工件就露馅。DSV-Mem 基准用 1000 道专家审校的题目考有状态视觉记忆,27 种配置里最强基线不到 45 分,主要败因是状态演化次数而非文本长度。

Stack Overflow 2026 开发者调查 AI 章节发布:编码助手以 66% 成为第一大 AI 用例,Claude Code 渗透 66% 领先 Copilot 的 59%,而编排框架 LangChain 30%、OpenAI Agents SDK 24% 仍是洼地,48% 的人只在能验证答案时才信任 AI。

arXiv 2610.08215 用反直觉规则的文字游戏证明:完整保留动作与反馈记录比蒸馏成规则更能支撑学习,换 harness 就能涨分降本。同日放榜的 Transect 则把百万 token 级长跑评测摊上可回溯时间线。

微软 Windows 与 Surface 发布会落地:Surface Laptop Ultra 2599 美元起配 RTX Spark 与 128GB 统一内存,五家 OEM 新机 10 月 16 日发货,Windows 11 给 Copilot 装上混合智能,Meta 的 Muse 原生进系统。

护栏框架 POLAR 用双层本体论给工具调用打可逆性分,低于阈值执行前拦下,判决结构化可审计。但实测泼了冷水:18 个模型与领域组合只有 8 个改善,零售域和强模型常常回退。

AI 老师的教学法大多靠示范数据或人工规则,不看学生是否真的学会。arXiv 2610.08778 的 Sherpa 用 LLM 模拟不同学习偏好的学生当陪练,以学习结果为奖励训练教师模型,教学法得分从 52.5 拉到 79.2。

个人 agent 替你逛电商下单前,先得证明它是你派来的。Sierra 与 Meta 联合发布 Personal Agent Protocol:OAuth 登录、访客或只读或可写三档会话、企业自选接入面,Shopify、Stripe、Walmart 等首批站台。

给 agent 攒记忆通常需要现成训练任务和判题器。arXiv 2610.08048 的 DAEDALUS 让一个 agent 出题、另一个做题,从失败轨迹提取经验并反复验证后收编入记忆库,三个基准平均成功率最高提升 15.9 个点。

Orosz 把 LDX3 纽约演讲整理成行业盘点:agent 发起的 PR 八个月涨九倍并在八月首超人类,Bun 重写只用 11 天,Uber 四个月迁完 60 万个测试,而人类代码评审正在变成盖章表演。

Meta 的 Muse 个人 agent 闭源,开源对位物 nanoMuse 来了:每台设备跑自己的 agent,中继只传文本、文件截图留在本机,记忆是可编辑的 Markdown,GPL-3.0 协议,附 12 页论文。

自改进 agent 越学越快,裁判却是固定的,结局要么平台期要么被钻空子刷分。NVIDIA 牵头的 VeriFine 让判官与策略、课程共同进化,人只在信息量最大的失败案例上出手校准。

agent 自进化最大的风险是把错觉当成长。arXiv 2610.08691 提出 ScienceClaw 基准:23 个学科上只用回放复现加独立任务改进都通过的更新,七轮进化把 OOD 成功率从 77.72 拉到 91.30。
