128GB 要加多少钱?微软新本配置阶梯全拆解
Surface Laptop Ultra 价目落地:2599 美元基础款配 RTX Spark N1X 与 24GB 统一内存,20 核 128GB 顶配约 5899 美元。发布会演示的本地跑大模型重活对应哪一档,这份阶梯表给出了答案。

发现 AI Agent、开发工具、开源项目与效率软件,跟上每日科技与工程实践。
编辑精选
Every 团队公开五个真实 Codex 工作空间:咨询负责人夜间补全数百条 CRM 记录,撰稿人沉淀个人声音档案,产品经理维护第二大脑。本文整理这些用法与三条共性规律。

最新精选
Surface Laptop Ultra 价目落地:2599 美元基础款配 RTX Spark N1X 与 24GB 统一内存,20 核 128GB 顶配约 5899 美元。发布会演示的本地跑大模型重活对应哪一档,这份阶梯表给出了答案。

多模态 agent 在闲聊场景表现尚可,一到频繁改版的专业工件就露馅。DSV-Mem 基准用 1000 道专家审校的题目考有状态视觉记忆,27 种配置里最强基线不到 45 分,主要败因是状态演化次数而非文本长度。

Stack Overflow 2026 开发者调查 AI 章节发布:编码助手以 66% 成为第一大 AI 用例,Claude Code 渗透 66% 领先 Copilot 的 59%,而编排框架 LangChain 30%、OpenAI Agents SDK 24% 仍是洼地,48% 的人只在能验证答案时才信任 AI。

arXiv 2610.08215 用反直觉规则的文字游戏证明:完整保留动作与反馈记录比蒸馏成规则更能支撑学习,换 harness 就能涨分降本。同日放榜的 Transect 则把百万 token 级长跑评测摊上可回溯时间线。

微软 Windows 与 Surface 发布会落地:Surface Laptop Ultra 2599 美元起配 RTX Spark 与 128GB 统一内存,五家 OEM 新机 10 月 16 日发货,Windows 11 给 Copilot 装上混合智能,Meta 的 Muse 原生进系统。

护栏框架 POLAR 用双层本体论给工具调用打可逆性分,低于阈值执行前拦下,判决结构化可审计。但实测泼了冷水:18 个模型与领域组合只有 8 个改善,零售域和强模型常常回退。

AI 老师的教学法大多靠示范数据或人工规则,不看学生是否真的学会。arXiv 2610.08778 的 Sherpa 用 LLM 模拟不同学习偏好的学生当陪练,以学习结果为奖励训练教师模型,教学法得分从 52.5 拉到 79.2。

个人 agent 替你逛电商下单前,先得证明它是你派来的。Sierra 与 Meta 联合发布 Personal Agent Protocol:OAuth 登录、访客或只读或可写三档会话、企业自选接入面,Shopify、Stripe、Walmart 等首批站台。

给 agent 攒记忆通常需要现成训练任务和判题器。arXiv 2610.08048 的 DAEDALUS 让一个 agent 出题、另一个做题,从失败轨迹提取经验并反复验证后收编入记忆库,三个基准平均成功率最高提升 15.9 个点。

Orosz 把 LDX3 纽约演讲整理成行业盘点:agent 发起的 PR 八个月涨九倍并在八月首超人类,Bun 重写只用 11 天,Uber 四个月迁完 60 万个测试,而人类代码评审正在变成盖章表演。

Meta 的 Muse 个人 agent 闭源,开源对位物 nanoMuse 来了:每台设备跑自己的 agent,中继只传文本、文件截图留在本机,记忆是可编辑的 Markdown,GPL-3.0 协议,附 12 页论文。

自改进 agent 越学越快,裁判却是固定的,结局要么平台期要么被钻空子刷分。NVIDIA 牵头的 VeriFine 让判官与策略、课程共同进化,人只在信息量最大的失败案例上出手校准。

agent 自进化最大的风险是把错觉当成长。arXiv 2610.08691 提出 ScienceClaw 基准:23 个学科上只用回放复现加独立任务改进都通过的更新,七轮进化把 OOD 成功率从 77.72 拉到 91.30。

并行多 agent 系统为什么常比单 agent 还慢?NeurIPS 2026 论文 SquidAgent 拆出重探索与对齐两笔隐藏成本,用会话 fork 和共享约定块压下去,实测对 Claude Code 墙钟提速 2.6 倍。

同时跑十个 coding agent,谁停下来等你只能一个个窗口翻。Manaflow 开源的 macOS 原生终端 cmux 把竖排标签、蓝环警示和通知面板做进终端本体,Ghostty 内核,GPL-3.0,27.7k 星。

BOTTLED 基准测 agent 自我降本:固定预算下自选方案做任务专用方案,Opus 5 保 82 个百分点 F1 省约 657 倍成本,但 60 次运行中 48 次低于自家零样本下界;AnyBottle 用贪心概念选择加嵌套 dropout 做出自适应大小的概念瓶颈模型。
