128GB 要加多少钱?微软新本配置阶梯全拆解
Surface Laptop Ultra 价目落地:2599 美元基础款配 RTX Spark N1X 与 24GB 统一内存,20 核 128GB 顶配约 5899 美元。发布会演示的本地跑大模型重活对应哪一档,这份阶梯表给出了答案。

发现 AI Agent、开发工具、开源项目与效率软件,跟上每日科技与工程实践。
编辑精选
Every 团队公开五个真实 Codex 工作空间:咨询负责人夜间补全数百条 CRM 记录,撰稿人沉淀个人声音档案,产品经理维护第二大脑。本文整理这些用法与三条共性规律。

最新精选
Surface Laptop Ultra 价目落地:2599 美元基础款配 RTX Spark N1X 与 24GB 统一内存,20 核 128GB 顶配约 5899 美元。发布会演示的本地跑大模型重活对应哪一档,这份阶梯表给出了答案。

多模态 agent 在闲聊场景表现尚可,一到频繁改版的专业工件就露馅。DSV-Mem 基准用 1000 道专家审校的题目考有状态视觉记忆,27 种配置里最强基线不到 45 分,主要败因是状态演化次数而非文本长度。

Stack Overflow 2026 开发者调查 AI 章节发布:编码助手以 66% 成为第一大 AI 用例,Claude Code 渗透 66% 领先 Copilot 的 59%,而编排框架 LangChain 30%、OpenAI Agents SDK 24% 仍是洼地,48% 的人只在能验证答案时才信任 AI。

arXiv 2610.08215 用反直觉规则的文字游戏证明:完整保留动作与反馈记录比蒸馏成规则更能支撑学习,换 harness 就能涨分降本。同日放榜的 Transect 则把百万 token 级长跑评测摊上可回溯时间线。

微软 Windows 与 Surface 发布会落地:Surface Laptop Ultra 2599 美元起配 RTX Spark 与 128GB 统一内存,五家 OEM 新机 10 月 16 日发货,Windows 11 给 Copilot 装上混合智能,Meta 的 Muse 原生进系统。

护栏框架 POLAR 用双层本体论给工具调用打可逆性分,低于阈值执行前拦下,判决结构化可审计。但实测泼了冷水:18 个模型与领域组合只有 8 个改善,零售域和强模型常常回退。

AI 老师的教学法大多靠示范数据或人工规则,不看学生是否真的学会。arXiv 2610.08778 的 Sherpa 用 LLM 模拟不同学习偏好的学生当陪练,以学习结果为奖励训练教师模型,教学法得分从 52.5 拉到 79.2。

个人 agent 替你逛电商下单前,先得证明它是你派来的。Sierra 与 Meta 联合发布 Personal Agent Protocol:OAuth 登录、访客或只读或可写三档会话、企业自选接入面,Shopify、Stripe、Walmart 等首批站台。

给 agent 攒记忆通常需要现成训练任务和判题器。arXiv 2610.08048 的 DAEDALUS 让一个 agent 出题、另一个做题,从失败轨迹提取经验并反复验证后收编入记忆库,三个基准平均成功率最高提升 15.9 个点。

Orosz 把 LDX3 纽约演讲整理成行业盘点:agent 发起的 PR 八个月涨九倍并在八月首超人类,Bun 重写只用 11 天,Uber 四个月迁完 60 万个测试,而人类代码评审正在变成盖章表演。

Meta 的 Muse 个人 agent 闭源,开源对位物 nanoMuse 来了:每台设备跑自己的 agent,中继只传文本、文件截图留在本机,记忆是可编辑的 Markdown,GPL-3.0 协议,附 12 页论文。

自改进 agent 越学越快,裁判却是固定的,结局要么平台期要么被钻空子刷分。NVIDIA 牵头的 VeriFine 让判官与策略、课程共同进化,人只在信息量最大的失败案例上出手校准。

agent 自进化最大的风险是把错觉当成长。arXiv 2610.08691 提出 ScienceClaw 基准:23 个学科上只用回放复现加独立任务改进都通过的更新,七轮进化把 OOD 成功率从 77.72 拉到 91.30。

并行多 agent 系统为什么常比单 agent 还慢?NeurIPS 2026 论文 SquidAgent 拆出重探索与对齐两笔隐藏成本,用会话 fork 和共享约定块压下去,实测对 Claude Code 墙钟提速 2.6 倍。

BOTTLED 基准测 agent 自我降本:固定预算下自选方案做任务专用方案,Opus 5 保 82 个百分点 F1 省约 657 倍成本,但 60 次运行中 48 次低于自家零样本下界;AnyBottle 用贪心概念选择加嵌套 dropout 做出自适应大小的概念瓶颈模型。

CoT 忠实度度量 CIA 实测三模型对齐仅 44.8 至 75.9 个百分点,用参数化忠实信号做后训练可大幅修复且不掉精度;ParanoiaEval 发现 agent 编码中的过度防御:证据明示无风险,11.2 至 58.7 个百分点的运行仍在做不必要风险处置。
