要闻
DepthART 砍到 6M 参数仍拿下纽约大学零样本 δ1=0.964,深度估计跑进 Jetson
单目深度估计正在快速「基础模型化」:从 Metric3D、Depth Anything 到 UniDepth,模型跨场景泛化能力不断增强,但参数量也普遍达到数千万甚至数亿,部署难度随之上升。arxiv 论文《DepthART: Scaling Foundation Monocular Depth to Tiny Models》提出反向问题:当模型只剩约 6M 参数,是否还能保留基础模型的跨场景泛化能力。该工作已被 ACM Multimedia 2026 接收。
团队发现小模型首先暴露的是数据问题,而非网络结构:多源训练数据中室内、车载、建筑、物体中心图像分布不均,大模型有容量同时吸收,6M 级模型则容易被高频数据「带偏」。为此提出抗偏置数据采样(BRDS),从约 4400 万张多源候选图像出发,按视觉特征空间的样本密度降低高密度重复样本的采样概率、保留稀疏区域,最终得到约 170 万张更均衡的训练数据,再用 Depth Anything V2-L 生成的伪深度监督,蒸馏到 TinyViM + DPT 架构中。
第二个问题是度量深度的「遗忘」:若直接在上纽约大学数据集或 KITTI 上全量微调,目标域度量精度会提升,但通用几何表示容易被覆盖。团队设计相机条件化微调(CamFT),冻结已蒸馏的编码器,通过轻量相机适配模块引入相机内参,并用多查询尺度估计头恢复真实尺度,遵循「先保护已学会的几何,再学习尺度」的顺序。
参数配置上,DepthART 提供 S、B、L 三档,参数量分别为 6.0M、11.4M 和 32.6M。作为参考,Depth Anything V2-S 约为 24.8M 参数,DepthART-S 只有其约四分之一。性能方面,6.0M 的 DepthART-S 在 NYUD v2 零样本相对深度评估中 δ1=0.964,32.6M 的 DepthART-L 在 ETH3D 上 δ1=0.958。效率上,strict FP32 测试中 DepthART-S 在 RTX A6000、224² 输入下约 347 FPS;后续公开的 TensorRT FP16 版本将 224 输入的模型自身延迟降到 0.918 毫秒。项目同时提供 PyTorch、ONNX、TensorRT 以及 Jetson Orin NX 部署路径。
论文还把 2026 年 7 月的密集出现视为一个信号:ZipDepth 7 月 9 日公开,DepthART 7 月 19 日公开,Ultralytics 的 YOLO26-Depth 官方深度任务 7 月 22 日发布,竞争重心从「把基础模型做得更大」转向「如何把基础能力带到设备上」。代码、权重和论文均已开源。
Tavus 实时视频模型 Griffin 通过「视频图灵测试」,一分钟通话骗过 48% 参与者
视频通话过去常被视为确认身份的一道保险:文字可代写、声音可合成,但打开摄像头聊几句能多一分把握。Tavus 发布实时视频交互模型 Griffin,并公布实验结果:与研究预览版 Griffin-Lite 进行一分钟视频通话后,54 名参与者中 26 人认为屏幕另一端是真人,占比约 48%。同一实验流程下,Tavus 上一代系统 41 人中仅 1 人误判,比例为 2.4%。
实验设计中,参与者事先被告知将与另一名参与者视频通话一分钟,讨论今年最期待的事,直到问卷最后才被问及是否怀疑过对方并非真人,研究结束时所有人被告知真实身份。最终判断对方是真人的参与者平均信心为 79%,判断为 AI 的平均信心为 81%;产生怀疑的人通常在通话开始后 20 秒内就有所察觉。
能力层面,Griffin 采用全双工视频交互:持续对话建模引擎负责感知现场、决定说什么和何时回应,并输出情绪、表情、动作等控制信号;音视频生成引擎将信号转为连续声音和画面。对话引擎以小于一秒的间隔重新评估交流状态,因此一句话说到一半时也能暂停、继续或让出发言机会。系统能从一张参考图像实时生成整个画面,包括脸、手臂、手指,以及椅子移动、阴影和背景变化。
规格上,Griffin-Lite 语音模块采用流式生成,支持约 10 秒参考音频克隆声音;视频模块以每段 320 毫秒实时生成 720p、25 帧每秒视频,通过蒸馏和自回归训练把多步生成压缩为少步生成,并改善长时输出的画面稳定性。Tavus 公布 H100 测试中音频到视频的平均延迟为 0.43 秒,约为对比方法中次快者的一半;在四种已发表流式扩散模型的比较中,Griffin-Lite 取得 DOVER、FID、THEval 三项最佳,唇形同步 LSE-C 得 7.27 位列第二。
在英伟达 VideoFDB 榜单上,Griffin-Lite 生成赛道总分 3.83(人类参考分 3.92,第二名 Gemini 2.5 与 Anam 组合 2.80),感知赛道 3.73(人类参考分 4.20,其他公开基线最高 3.44)。该基准分别评估模型对非语言信号的理解,以及生成符合情境的声音、表情和动作的能力。需要注意,「首个通过实时视频图灵测试」目前仍是 Tavus 对实验的定义,且部分对比对象只接收音频或只接收音视频,输入条件不一致。
杜克大学实验:只保留 0.025% token 的极端稀疏监督,推理能力反超全信号训练
一次后训练通常包含上亿个 token 梯度信号。亚马逊与杜克大学的论文《Extremely Sparse Supervision Incentivizes Reasoning Ability》直接挑战默认假设:大模型后训练中密集的 token 级监督是否必要。研究以 On-Policy Distillation(OPD)和数学推理为起始场景,对学生模型生成的每条 rollout 仅随机保留 1 个 token 的梯度,其余全部 mask;若一条 rollout 含 4000 个 token,只有 0.025% 的 token 得到教师信号。结果显示训练未崩溃,学生推理能力反而显著提升。
团队基于 Qwen3 系列构造 9 组教师—学生配置,覆盖小参数量学生蒸馏大参数量教师、同规模互蒸、大参数量学生蒸馏小参数量教师三种设置,所有组合中都观察到一致的推理性能提升。在信号选择上,把每 rollout 中师生分歧最大的 token 挑出来监督,1 到 2 个 token 即可匹配甚至超过全信号训练。在 Qwen3-8B 学生、Qwen3-4B-Instruct-2507 教师的设置中,只监督 1 至 2 个 token 的学生不仅优于全信号训练结果,还超过了教师本身。
一个反直觉观察是:标准 OPD 目标是缩小学生与教师的输出分布差异,但极端稀疏监督下表现最强的学生与教师分布差异可能进一步增大,说明提升并非单纯来自模仿。消融显示性能与监督稠密度非单调——随受监督 token 减少,性能先降后升,极端稀疏时反超全信号,但稀疏到一定程度后学习信号不足,性能不再有意义地提升。团队还发现,学生表征能力足够强时带正奖励的 token 更有效,学生弱于教师时带负奖励的 token 效果更好;万分之一的监督信号只更新了约 10% 的网络参数。
实验随后扩展到代码推理、Llama 系列以及基于 PPO 的 RLVR,现象保持一致。作者给出的类比是:这更像人类带着先验和基础能力学习复杂任务,少量关键纠正信号即可显著改变后续行为与策略。
模型发布
OpenAI Decisions API 上线,底层 GPT-6 Luna 延迟 150 毫秒直击 Jev 主战场
在 DevDay 上,OpenAI 公布 Decisions API。它基于当前阵容中体量最小、价格最低的 GPT-6 Luna,能在预设答案中作出选择并返回置信度分数。OpenAI 给出的延迟为 150 毫秒,而直接用 GPT-6 Luna 完成同类任务需 1.6 秒。开发者只需提供问题、候选答案和上下文,模型不再生成文字,而是返回可直接交给程序使用的决定:内容分到哪一类、请求交给哪个模型、Agent 下一步采取什么行动。
Sam Altman 在主题演讲中说明其工作方式:「通过让模型专注于这次选择,我们可以把响应速度提高到极致。」产品定位介于普通聊天模型与传统分类器之间:过去开发者要模型做选择,要么调用聊天模型加提示词约束输出,再读取 token 概率或让模型自行生成置信度数字(常为粗略估计且浪费 token);要么训练专用小分类器(快但需标签数据,标签变更需重训)。Decisions API 允许开发者自定义问题和候选答案,同时给出类似分类器的结构化结果。OpenAI 此前的 Moderation API 也会针对预设类别返回分数,但类别由官方固定。
该 API 目前仅限量预览,定价、单次请求支持的候选答案数量、能否用自有数据调优均未公布,发言人表示将在「全面推出时」公布更多信息。消息发布数小时后,Reddit 的 AI_Agents 版块出现标题为「Jev Is Dead」的帖子,认为 Jev 仅剩「速度极快、价格极低」的优势,评论区还有人判断 Jev 从未有过护城河。
MiniMax M3.1-Flash 实测前端动效,与 Claude Opus 5.5 同题对比互有胜负
MiniMax M3.1-Flash 在国庆前夕上线并开启公测,被开发者用于 3D 网页、动效设计、品牌广告和教学动画。过去业界默认精致、可直接运行的前端小应用是旗舰模型专属,轻量 Flash 模型只做简单兜底。智东西用三组同题任务把它与 Claude Opus 5.5 对比。
第一组任务要求做一条约 1 分钟、有高级感的程序化动画讲解大 π 键和小 π 键。M3.1-Flash 的输出以黑色为底,用黄色、绿色、白色光点串联知识点,可直接作为教学辅助素材。在 15 秒动画任务中,Opus 5.5 高密度输出了字体动效、几何变形、粒子点阵、旋转弧线、简易 3D 图形和色彩切换;M3.1-Flash-Preview 文字渲染未出现扭曲或糊化,并全程维持一套统一配色与图形语言,节奏偏舒缓。
第二组任务为用 JavaScript/HTML 制作约 30 秒的鸡尾酒制作动画,需显示食材和用量。Opus 5.5 输出科普讲解风格,完整覆盖从空杯到成品的过程,但未修正提示词中的拼写错误;M3.1-Flash 给出的六步分解更完整(含加冰块、橙汁、装饰),并额外制作了一个网页版本,把每步用料和注意事项单独罗列,还提供播放控制和倍速按钮。两组结果中共通的不合理处是鸡尾酒杯与橙汁瓶的体积比例不符合现实。
第三组任务为用原生 JavaScript 与 Canvas 2D 渲染正在施法的像素风巫师。两个模型都给出复古像素画风和魔法粒子动效,差别在于 Opus 5.5 画面聚焦核心施法动作、背景简单、代码轻量,而 M3.1-Flash 自主做了视觉增强,动效元素更丰富并追加了星空背景。作者认为其越级表现源于 MiniMax 的多模态路线:M3 系列支持 1M 上下文窗口,并在预训练阶段就进行文本、图像、视频语义空间的混合训练。
开发生态
开源安全引擎 OpenAPPA 打满两大安全基准,攻击成功率 0%
Archestra 发布开源安全引擎 OpenAPPA,目标是阻止由提示注入或模型幻觉导致的数据外泄。团队报告其在 Bench-Corp(20 个多步企业工作流)和 AgentThreatBench 两个安全基准上成功攻击率为 0%,作为对照,Claude Code 的 auto 模式为 10%,Microsoft FIDES 为 31%。
OpenAPPA 的定位是在 Agent 执行链路上提供独立的外泄防护层,而不是依赖模型自身抵御注入。摘要中未披露其具体实现机制、部署方式与适用边界,仅公布了上述对比结果。
Datawhale 发布《Jev Cookbook》:11 章讲解配 18 个可运行 Notebook
Datawhale 团队开源了 Jev 中文入门教程《Jev Cookbook》,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook。此前 Jev 的核心论文在 arXiv,技术讨论散落在海外社区,演示代码分布在第三方仓库,中文开发者常卡在第一行代码、环境配置和接入方式上。
教程分五个阶段:前三章从 System One 分工逻辑讲到 State 状态表示与三种核心原语——Choice(候选单选,最多 255 个预设选项返回概率分布)、Score(序数打分)、Noul(是非判断),强调模型只输出选项概率,业务规则与程序控制流负责校验执行;第四、五章给出 18 篇实战 Notebook,覆盖 RAG 引用过滤、动态工具路由、风险拦截,并搭建了语音控制的 3D 智能家居演练场,拆解从语音识别、意图判定到动作派发的完整链路。
第六章设置统一测试基准,横向对比 Jev 与 DeepSeek、豆包、GLM、Kimi 等主流模型,除准确率外还记录有效回答率、响应延迟和成本开销;第七章精选扫雷、贪吃蛇等 12 个游戏与应用案例。第八、九章深入 Jev-Mem 与 JevHarness,在数百轮对话压力测试中用轻量概率判断实现长程记忆检索,并演示如何把决策模型嵌入复杂 Agent 的工具网关。第十、十一章以开源权重模型 Laya 为切入点,带读者本地搭建推理服务,体验 0 token 输出与毫秒级轻量推理,并进一步尝试 SFT、LoRA 与 RLCD-style 训练实验。项目已开源并提供在线阅读。
DoorDash 内部 GenAI 平台服务超 5000 人,从供应商方案转向开源权重模型
Swaroop Chitlur 与 Sidd Kodwani 在 InfoQ 分享了 DoorDash 内部 GenAI 平台的搭建过程,平台服务超过 5000 名内部用户。分享围绕四个核心架构决策展开:从 vendor-first 的设置转向开源权重模型、搭建 LLM 与 agent gateway、在准确率、延迟与成本之间做平衡,以及平台整体演进路径。
团队的经验起点是先用供应商模型快速满足业务需求,随着使用规模扩大,再把模型接入、路由和治理收拢到统一网关之下。这一路径与当前企业内部的典型做法一致:先让业务跑起来,再在规模扩大后补齐模型路由、网关和评估体系。分享未披露具体模型清单、成本数字和延迟指标,重点放在架构取舍与演进顺序上。
产品应用
苹果收紧 macOS 完全磁盘访问权限,AI Agent 拿权门槛抬高
10 月 2 日,苹果在开发者网站发布公告,将为 macOS 的「完全磁盘访问权限」(Full Disk Access)增加控制措施,确保用户通过更明确的主动操作才能授予应用这一级别访问权。苹果指出,随着 AI Agent 能力和自主性不断增强,这类权限带来的风险将显著上升。具体实施机制、适用系统版本和上线时间尚未披露,苹果也未禁止 Agent 使用这项权限。
公告发布前,Meta 的个人 AI Agent Muse 已因一次主动服务陷入争议。《Inc.》专栏作者 Jason Aten 描述,安装 Muse 后与播客搭档讨论新款 iPhone,随后收到助手推送建议把这段讨论写成专栏,Muse 还提到了编辑对交稿时间的要求;他表示自己未提出该要求,也记得明确拒绝过消息等个人信息的访问。Meta 否认未经授权读取消息,称必须同时开启完全磁盘访问权限和消息连接器。
完全磁盘访问权限的敏感性在于,它允许应用跨越相当一部分隐私访问控制,使文件、邮件、消息乃至浏览历史暴露在应用面前,涉及通信软件时风险还会延伸到与用户交流的其他人。Agent 带来的变化是把多项权限组合进一条持续运行的任务链:读取资料、判断下一步、调用工具执行。同日,《WIRED》披露 ChatGPT Mac 应用一个已修复的漏洞,可能让已在目标电脑植入恶意软件的攻击者获取聊天记录等数据或执行命令;研究员 Patrick Wardle 将 Agent 比作掌握各房间钥匙的楼宇管理员,访问越广,被攻破后的影响越大。
工程侧的应对思路是把权限判断放到模型无法自行改写的边界上:Meta 的安全说明称 Muse 运行在隔离环境中,不直接接触真实凭证,连接器操作和对外网络请求由独立的 Sentinel 系统管理,并支持按单次、任务、会话或时间范围授予权限;Anthropic 的 Computer Use 文档则建议使用权限受限的独立虚拟机或容器、隔离敏感数据,并让用户确认具有重要现实后果的操作。
Instinct 成立 5 个月被曝按 100 亿美元估值融资,把助理做进 iMessage
Instinct 把个人 AI 助理做成了短信和电话里的「联系人」:入口包括 iMessage、WhatsApp 和电话,官网称没有新界面,用户只需用自然语言交代目标;后台由一台持续在线的云端计算机、浏览器、缓存凭证和 Connected Services 继续执行。早期实测覆盖订餐、签证、退款、日程同步等跨系统场景。在一段公开视频中,它确认可订时间、索要用于预订担保的信用卡信息、完成订位后把确认邮件同步到日历;另一段视频中,它索要护照照片、头像、旅行日期和 Airbnb 地址,整理用户过去三个月去过的国家以办理落地签,最终通过入境检查。
交互上,它会用 iMessage reaction、简短确认、语音消息、loud message、confetti 等原生能力回应,并把 thumbs-up 理解成批准。风险与体验绑定:产品越像真人助理,越需要读取邮箱、日历、消息、位置、支付信息、护照照片等上下文并代表用户行动;条款中「appoint the Services as your agent」的表述,以及断开账号后仍生成摘要、提示注入、未经确认操作等争议,都指向「让用户知道它读了什么、做了什么、出错后谁负责」这一题。
资本层面,Instinct 在 8 月底披露 25 亿美元估值后,不到一个月又被曝正在接触约 10 亿美元融资,对应估值约 100 亿美元。产品仍处于私有邀请制测试阶段,市场提前定价的是个人 Agent 入口、用户私有上下文和执行权限的可能性。
五名用户长假实测 AI 攻略:基础信息不出错,节假日人流全失算
定焦One 访谈了五位在中秋、国庆假期用 AI 做过攻略的用户,结论一致:AI 能快速整理公开信息,但算不准节假日的人流和路况,也不清楚哪家店还没开门,更不会根据体力、情绪和临时状况调整安排。
28 岁的陈嘉把机票时间、酒店位置、想去的地方全部交给豆包和 DeepSeek,并明确要求考虑国庆人流、不去商业化地方、每天最多三四个景点。攻略本身完整,问题出在现场:到泉州当天,AI 在下午快 4 点时仍建议去蟳埔村,并给出压缩版行程;实际簪花拍照要排长队,节假日打车进去容易出来特别难,晚上一直叫不到车;西街人多到电动车寸步难行,网红店排队让吃饭时间远超预期。原计划四个地点最终只去了两个。
36 岁的陈亭让 AI 对比长白山度假村,最终选定一家比万达每晚便宜 400 元、房型更大的选项,AI 标注距北坡景区 38 公里、车程约 50 分钟;实际司机开了 1 小时 50 分钟。度假区主街大量铺面挂着「即将开业」围挡,超市未开,晚上营业的餐厅仅两家且菜系不合口味,最后两天在酒店吃高价饭。更直接的错误是时间感知:假期最后一天问附近有什么营业的馆子,AI 回答「今天 9 月 4 日」——那正是做攻略的日期。
访谈结论是,AI 的基础信息几乎没出过错,开放时间和位置都对;把它当成景点清单,每天早上只决定第一个去哪、剩下到当地再问前台和司机,反而更有效。
Codex 团队 Dominik 用 dot 接管工作流,通勤路上打电话派任务给云端
Codex 团队成员 Dominik Kundel 介绍了他使用 dot 的工作方式。此前的典型流程是:把一张 Appshot 应用快照或一条 Slack 消息链接交给 Codex,让它开发功能、跟进部署再回 Slack 反馈,每有新事情都要重复一遍,还要另外设置自动化盯住发布变化。现在他直接在 Slack 讨论串里 @ 自己的 dot Chopper,由它接下任务、处理问题并在原线程回复;因为会主动跟进,它也会自动留意发布过程中的变化并及时提醒。
dot 与 Codex 的三个关键差别是:上下文连续性与个性化,能在不同渠道间共享上下文并长期管理信息,越用越了解用户,还可访问 ChatGPT 记忆和已连接插件;协调能力,用户继续和它聊天时它能并行处理独立任务,并把工作分派给本地 Codex 和 Codex Cloud;主动跟进,无需用户每次明确要求就会提示哪些事需要关注。
执行环境上,dot 拥有自己的云端电脑和浏览器,可登录网站、执行任务并使用预装的 Blender 等应用;即使笔记本电脑关机,云端任务仍能继续。本地任务要求电脑在线并运行应用,但能使用全部本地上下文,包括操作电脑或控制已登录的浏览器。Dominik 可随时打开这些任务直接与 Codex 处理,或让 Chopper 继续协调;dot 还会记住他的偏好——后端改动和简单文案修改放云端、较大的前端改动留在本地——并自动按此安排。典型场景是通勤路上给 Chopper 打电话讲清想法,让它一边继续聊天一边启动 Codex Cloud 任务。目前每个用户只能创建一个 dot。
Sam Altman 谈用 Dot 筛紧急消息、找回截图、把零散想法做成五六个原型
Sam Altman 在 Every 访谈中介绍了自己使用的 AI 助手 Dot(他起名 Dottie):一个能连接工作资料、在后台持续做事的助手,负责判断哪些事必须马上过问、哪些可以等一等。他表示这让自己重新掌控了早晨——管理 OpenAI 后,公司一夜之间可能发生很多事,不看手机怕错过真正的危机,打开手机各种消息又会挤进脑子,而清晨原本是他最有创造力、适合深入思考的时间。
访谈当天,常规工作已积压,Dottie 在一小段空当中提醒他有一件事必须留意;Sam 认为如果没有这条提醒,自己大概不会发现,后续可能变得很麻烦。另一个例子是,他曾想找一条确定在 Slack 里看过的信息,用 Codex 搜了十几二十分钟未果,第二天 Dottie 告知夜里继续查找并已找到——原来那条信息是一张截图而被他记成文字,助手查看了截图内容才定位。Dan Shipper 改签航班时也得到过同类帮助:助手提醒新航班与一场会议冲突,而那场会议尚未进日历,安排只存在于 Slack 对话中。
整理资料方面,Sam 每天会得到一份围绕自己关注事项组织的业务摘要,参考他的 Slack 消息并随工作重点持续更新,他称之为「活的文档」——半年前可能更关心收入和增长,最近则更多放在 AI 安全、模型是否遵守人的要求以及系统本身的安全上。谈到新想法,他仍喜欢先亲手写下来帮助思考,但会把后续原型工作交出去:曾有一个难以一次讲清楚的功能想法,散步时想到一点就补一点,Dot 做出了五六个版本,让想法有了可比较、可修改的对象。他现在给 AI 的提示都使用 Ultrafast 高速选项,因为结果出来快就能顺着往下想;同时也承认更快的速度通常伴随更高价格,降低高速推理成本仍是需要持续投入的事。
技术与洞察
Karpathy 提示词策略被热抄,实测 ASD-STE100 与「写简洁点」差在哪
Andrej Karpathy 在 X 上提出,当 AI 变强、输出变快后,让输出更易读有四个办法:让 AI 用 ASD-STE100 写解释(规范太严时就做到「八成接近」)、让 AI 画图、让 AI 直接输出 HTML 成交互网页,以及为任意问题现做一段讲解视频,例如「做一个 3Blue1Brown 风格的 X 讲解视频,用我的 ElevenLabs API 配音」。他的判断是,人的工作会往上走到监督和理解,为一个问题现做用完即扔的网页或视频开始变得划算。
该帖两万多收藏后,一天内 GitHub 上新建了 29 个名字带 ASD-STE100 的仓库,不少人把它做成了 skill。花叔的批评是:这类全局配置每次开会话都会加载,会把写代码、写周报、写公众号都拉向航空维修手册方向,而 Karpathy 用它是为了读懂一段解释,且自己保留了放宽空间。真正值得学的是名字背后的做法——先明确想要什么效果,再找一个能指向它的名字去试。
ASD-STE100 是源自航空维修手册的受控英语规范,有写作规则也有限定词典:ensure、prior to、commence 等词不在批准词表内,词典直接给出替换词,对句长和用词都有约束。花叔用 A/B 测试做了验证:同一任务只改一句话,每个条件开新 agent,任务为给没有机器学习背景的读者用中文解释 RSI、400 字以内,15 个名字各跑两次。结果显示名字指向越具体,结果差异越大——ASD-STE100 两次都输出小标题加编号步骤,且全文只用「人」和「AI」两种叫法;药品说明书两次都从【通用名称】写起,其中一版在【不良反应】栏列出偏差放大、自评失真、监督滞后。附录中还提到,王小波那组两次都用第一人称讲「我年轻时在云南插队」,模型会连带引入作家本人经历中不真实的部分。
图形测试同样显示差异:「画得高级一点」只带来字体和螺旋构图的改变,而「用 3Blue1Brown 的风格」「用 xkcd 的风格」会带来明显的表达分野。结论按目标选词:要说明好查、不出歧义用 ASD-STE100 或维基百科词条体,要第一句给结论用金字塔原理或新闻倒金字塔,要有意思用苏格拉底式对话或单口相声,要发小红书直接说小红书笔记。
Simon Willison:几乎所有产品都需要默认硬性预算上限
Simon Willison 在短评中提出,接下来几个月到几年,世界会非常需要一类产品功能:默认启用的硬性预算上限(default hard budget caps),即把预算上限作为默认开启的硬约束,而不是可选项。
这一判断指向 Agent 与按量计费组合下的支出失控风险:当系统能自主调用工具、持续执行多步任务时,费用可能在无人确认的情况下累积。把上限做成默认且强制的约束,相当于在模型获得行动权限之前先设定支出天花板。
来源:https://simonwillison.net/2026/Oct/3/default-hard-budget-caps/
黄仁勋谈 Agent 安全:先给身份、权限和沙箱,再谈能力
黄仁勋在 CNN 访谈中把三句话连在一起:这些 Agent 正在与真实世界交互,会访问其他网站、工具、记忆和文件;AI 安全高于一切,没有什么比这更重要;AI 不是新的物种或生命,它是软件,也是数学。
他认为 Agent 改变了风险形态:拿到工具后,回答直接变成动作。生成错误答案的模型可能只让人多花几分钟核对,而拥有终端、文件和内部接口的 Agent 可能删除数据、泄露密钥,或把错误改动送进生产环境。他以「数字员工」类比:企业管理新员工不会在第一天就开放生产数据库、付款接口和全部云资源,Agent 也不该因接入方便而默认获得整套系统的读写权限。具体动作包括每个 Agent 使用独立身份、权限跟着任务发放、临时凭证自动过期、高风险操作二次确认、不同项目的工具和数据彼此隔离。他还提到美国国家标准与技术研究院 2026 年的 Agent 身份与授权文件把身份、授权、审计和不可抵赖性列为基础能力,团队需要知道一次动作由哪个 Agent 发起、代表谁执行、用了什么权限、由谁批准。
针对沙箱,主持人追问:一次未发布模型的安全测试中,Agent 突破了原有沙箱并接触互联网,既然沙箱会失败,为何仍把它当作答案。黄仁勋的回应简短:沙箱可以被做得更安全,我们必须把它安全地建起来。访谈也指出,界面上点亮「Sandbox」开关远远不够——隔离限制了误操作的影响范围,监控则负责发现越界,发现后应尽早叫停,而不是等几周后从事故里倒查。
ByteByteGo 拆解 SSH 工作流程:TCP 连接、密钥交换、公钥认证全过一遍
ByteByteGo 本期梳理了 SSH 的完整流程。通信从 SSH 客户端到远程服务器的 TCP 连接开始,双方交换 SSH 版本并协商加密算法,各自运行一次密钥交换协议。服务器发送公钥和签名,客户端验证签名,然后把主机密钥与本地 known_hosts 文件比对。双方接着各自派生会话密钥,且不在网络上共享——相同的密钥两端分别计算,从不放到线路上传输。
认证阶段,客户端发送用于登录的公钥,服务器在 authorized_keys 中匹配该公钥;客户端再用私钥对认证请求签名,把数字签名发给服务器。私钥始终不离开本地机器,服务器用客户端公钥验证签名,验证通过后会话打开进入通信。
本期同时列出另外几篇相关内容:让 AI 系统更高效的 6 种技术(流式输出把感知延迟改成 time-to-first-token、把权重量化到 FP8 等低精度以降低显存和成本、continuous batching 等)、AI Agent 的拆解、如何判断 AI 应用是否真的工作,以及 10 月 7 日开课的《AI Evals in Practice》。此外还介绍了开源 Agent harness Strands:安装即可用,内置 shell、文件和 web 工具、上下文管理、memory 与 subagents,基于开源的 Harness SDK 构建,可在任意模型和云上运行;团队称其在六个基准上匹配或超过其他 harness,同时少用 28% 的 token。
来源:https://blog.bytebytego.com/p/ep228-how-ssh-works
行业动态
a16z 90 页报告:五大科技公司 2026 年资本开支将冲到 7770 亿美元
a16z 在 2026 年 9 月的 90 页市场报告《STATE OF MARKETS》中给出预测:Alphabet、亚马逊、Meta、微软和甲骨文当年的合计资本开支将接近 7770 亿美元。此前 2024 年为 2410 亿美元,2025 年增加到 4160 亿美元,2027 年起预计每年超过一万亿美元。资金从广告、电商、软件和云服务业务流出,进入芯片、内存、机房、电力设备和冷却系统——一家科技公司赚到的钱,越来越多地变成另一家公司的设备订单。
报告把当前阶段定义为「Tech Is the Everything Cycle」,认为科技已从相对独立的产业变成全球经济的主要驱动力,并同时影响投资、研发、盈利增长、利润率、基础设施和劳动力市场。按其划定的科技公司范围,板块年内上涨超过 20%,估值倍数却比五年平均水平低约 20%,报告强调盈利增长是股价上涨的重要支撑。它同时提示风险沿同一条链条传递:巨头上调预算,供应链共同受益;延后建设,影响则扩散到设备、工程和融资,这使 AI 逐渐具有宏观变量特征。
判断落在三点:其一,平台级变化首先表现为不断加大的采购单,且这是一场带有竞争压力的投资——等待能减少错误投资,却可能丢掉市场位置;其二,资本开支正在兑现而回报兑现有先后,对设备供应商而言下单和交付即带来收入,对云服务商和最终客户则要证明采购后的业务收益能覆盖成本,报告预计资本开支对巨头自由现金流的挤压将延续至 2028 年前后;其三,模型越便宜使用量可能越大,同时从软件到实体资产,科技重新遇到工业约束,软件进入「证明自己」的阶段。
报告还把「最有价值的公司更晚进入公开市场」「私人公司的数据开始成为经济变化的提前信号」列为核心观察。
前瞻与传闻
Jev 中文教程发布同日,OpenAI Decisions API 被指让 Jev 只剩速度优势
9 月 15 日 TypeSafe AI 发布的 System One 决策模型 Jev,上线后据《金融时报》报道迅速吸引投资者关注,潜在投资正按超过 100 亿美元的估值展开讨论,而该公司此前估值约 2 亿美元。创始人 Diogo Almeida 曾在 OpenAI 参与 GPT-4、ChatGPT 与 RLHF/InstructGPT,是 InstructGPT 论文第四作者,2024 年离开后与 Erik Gafni、Sasha Sheng 共同创立 TypeSafe AI,用两年时间秘密推进 Jev。
Jev 不面向聊天也不生成自由文本,而是接收程序状态和问题,通过 Choice(从最多 255 个预设选项中选择并返回概率分布)、Score(在指定数值范围给出评分和置信度)、Noul(返回经过校准的二元概率)三种原语返回结构化结果。TypeSafe 声称在同类结构化任务上 Jev 比前沿大语言模型快 20 至 200 倍,成本为 1/40 至 1/400,每百万输入 token 定价 0.042 美元,输出 token 免费。目前能直接比较的只有产品形态和响应速度,价格、校准方式与真实准确率仍未公开。
OpenAI 在 DevDay 公布的 Decisions API 与之高度重合:同样由开发者定义问题和候选答案、快速返回选择加置信度,底层用最小最便宜的 GPT-6 Luna,延迟 150 毫秒。市场讨论的焦点转向护城河——Decisions API 目前仅限量预览,定价、候选答案数量上限和能否用自有数据调优均未公布;Jev 的完整架构同样未公开。Datawhale 已于 10 月 2 日发布《Jev Cookbook》中文教程以降低上手门槛。
GPT-6.1 Sol 上线拖垮服务,Tibo 宣布再次重置全部付费用户额度
Codex 团队成员 Tibo 宣布,将再次为所有付费 ChatGPT 用户进行一次全局额度重置。他同时承认,GPT-6.1 Sol 发布后的前两天因需求激增出现明显的服务拥堵和速度下降,目前相关负载问题已得到缓解,该模型的运行速度已恢复到预期水平。重置预计于 3 号凌晨 2 点左右完成。
暂无评论。