Anthropic公开3万Agent研发数据:Claude自主研发占比达26%【AI早报 【AI 早报 2026-09-19】
今日AI领域重点动态包括:Anthropic首次公开AI研发自动化与Agent监控核心指标,显示3万Agent已承担超九成研发工作;华为加速昇腾960DT AI芯片发布至明年Q1;全球首个专家级通用医疗影像AI登《Science》并开源;Jina发布高吞吐低成本OCR模型等。
今日概览
- Anthropic公开3万Agent研发数据:Claude自主研发占比达26%
- 华为加速昇腾960DT AI芯片发布至2027年第一季度
- 全球首个专家级通用医疗影像AI登《Science》并正式开源
- Anthropic优化30余个生物模型,蛋白质设计成本最高降98%
- PrismML发布三进制Bonsai 2 27B模型,体积仅5.9GB保留98.2%性能
- 美军情报因AI幻觉误判中国商船运核部件,几乎触发军事冲突
- OpenAI发布专用于法律领域的Astra for Law模型
- Jina发布jina-ocr-v1模型,低成本GPU上文档解析吞吐翻倍
- FAA投入8.75亿美元打造AI空管系统,预计9月21日首秀
- 研究者利用Claude攻破OpenAI系统,暴露前沿AI安全漏洞
- 论文提出“语言不可读性”概念,指出LLM安全机制存在根本缺陷
- MIT Technology Review回应AI安全热点问题:不存在AI灭世现实场景
- 开发者从零手写工具调用LLM,分享完整训练经验
- Anthropic与埃森哲合作投入10亿美元布局前沿AI独立评估
- Claude Code 2.1.277版本新增对AGENTS.md文件的支持
大模型与工具更新
Anthropic公开3万Agent研发数据:Claude自主研发占比达26%
Anthropic首次公开AI研发自动化与Agent监控的核心指标体系,基于Epoch AI的自动化分级标准(AL0至AL5),截至2026年8月,Claude完全自主(AL5)的研发占比为0,AI主导(AL4)的研发占比达26%,AI深度协作及以上(AL3+)的占比超过90%。Anthropic内部目前约有30000个AI Agent同时开展研发与工程工作,实时动作监控覆盖率100%,2026年8月共分析超10亿次Agent决策,其中0.002%的动作被直接拦截,相当于每47000次操作拦截1次,所有拦截动作均在一周内由人类复核。离线监控覆盖率同样为100%,每周标记约10万份记录,经分类器过滤后最终筛选出约50份最高优先级记录移交人类安全员复核。抽样2026年7月中旬一周的算力消耗显示,AI研发总算力中安全研究所占约6%,AI自主研发算力中安全研究所占约12%。Anthropic计划引入多家独立第三方机构进驻,授予其与内部风控团队相同的系统权限,全程监督上述指标。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247519062&idx=1&sn=06eac96ac1876878d586ef266792a968
PrismML发布三进制Bonsai 2 27B模型,体积仅5.9GB保留98.2%性能
PrismML发布Qwen3.8 27B的三进制量化版本Ternary Bonsai 2 27B,模型体积为5.93GB,远小于FP16版本的53.80GB,在20个基准测试中平均保留父模型98.2%的性能。该模型支持文本和图像输入,上下文长度达262K token,可在16GB内存的笔记本电脑或单张24GB显存的GPU上运行,需使用PrismML的llama.cpp分支或MLX运行时。模型总参数27.36B,仅0.0976%的参数(26.2M)保持高精度,为循环状态路径和归一化权重,其余权重均为三值(-1、0、+1),每128个权重共享1个FP16缩放因子,平均每权重仅占1.71比特。在EvalScope和vLLM的thinking模式测试下,其性能接近原版Qwen3.8 27B,此前首版Bonsai 27B三进制版本的性能保留率约为95%。 来源:https://www.marktechpost.com/2026/09/18/prismml-releases-ternary-bonsai-2-27b-a-5-9-gb-apache-2-0-model-retaining-98-2-of-qwen3-8-27b-performance/
Jina发布jina-ocr-v1模型,低成本GPU上文档解析吞吐翻倍
Jina AI发布端到端文档解析模型jina-ocr-v1,总参数3.4B,解码时每Token仅激活570M参数,在OmniDocBench v1.6基准上得分91.14,在olmOCR-Bench上得分83.4,均刷新同级别最佳成绩。在14款主流端到端系统的吞吐实测中,该模型以2.57页/秒的成绩领跑全场。针对单张NVIDIA L4等低成本显卡,模型采用自研的推测解码草稿头FastMTP,通过单个共享稠密块递归前向K=3步生成候选token,参数量与前瞻深度解耦,生成速度几乎翻倍,且输出与标准自回归解码严格一致。后训练阶段采用Dense Verifiable Rewards(GRPO)奖励机制,按部分正确程度分级给分,使olmOCR-Bench得分提升7.4分。在单张A100、并发32的测试环境下,模型每秒输出2792 token,单页输出1085 token,端到端吞吐达2.57页/秒,目前已在Hugging Face、魔搭等平台开源,同时提供API服务。 来源:https://mp.weixin.qq.com/s?__biz=MzkyODIxMjczMA==&mid=2247503626&idx=1&sn=8b4cd6a8470c0ac7a4bca09f3ab1425f
OpenAI发布专用于法律领域的Astra for Law模型
OpenAI发布面向法律行业的专用模型Astra for Law,基于GPT-6 Astra打造,针对法律工作场景进行优化,正式进军法律科技市场。 来源:https://the-decoder.com/openai-takes-aim-at-the-legal-market-with-astra-for-law/
Claude Code 2.1.277版本新增对AGENTS.md文件的支持
Anthropic的代码编写工具Claude Code在2.1.277版本中新增对AGENTS.md文件的支持,当项目文件夹内不存在CLAUDE.md文件时,Claude会自动读取并使用AGENTS.md文件作为指令依据。 来源:https://simonwillison.net/2026/Sep/18/thariq-shihipar/
行业应用与产业动态
华为加速昇腾960DT AI芯片发布至2027年第一季度
华为在Huawei Connect大会上宣布,将下一代昇腾960DT AI芯片的发布时间从原定的2027年第三季度提前至2027年第一季度,芯片性能实现年同比翻倍。新芯片将采用华为自研的Peerium计算架构,通过UnifiedBus技术链接大量AI芯片,配套的Atlas 950 SuperPoD和SuperCluster是该架构的首批落地系统,其中SuperCluster最多可连接25.6万张加速卡。科技分析师Rui Ma指出,此次公布的SuperPoD系统规模较华为此前披露的有所缩减,体现了速度与规模的平衡。发布时机恰好处于特朗普与习近平会面前一周,华为轮值董事长徐直军表示美国半导体限制无法阻止中国追求芯片自研,中国科技企业需要加速研发缩小与美国的技术差距。 来源:https://theaiinsider.tech/2026/09/18/huawei-moves-up-launch-of-next-generation-ascend-960dt-ai-chip-to-early-2027/
全球首个专家级通用医疗影像AI登《Science》并正式开源
阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上国际顶级学术期刊《科学》(Science),面向腹部增强CT诊断场景,可一次性识别超过146种病症,平均AUC达0.913(满分1),首次达到影像科专家水平,目前已正式开源。模型采用国际首创的“器官级细粒度对齐”技术,将复杂的三维CT拆分为单个器官,实现影像与对应报告的精准匹配,无需额外人工标注即可支持更多诊断任务。在近4万次真实临床检查中,模型AUC达0.913,在与26名影像科医生的对比测试中,平均准确率超过23名医生。在AI提示下,放射科医生诊断敏感性提高10%,诊断用时减少30%以上,低年资医生可达到高年资医生的诊断水平。在训练时未覆盖的急腹症识别场景中,模型AUC仍达0.904,表现稳定。 来源:https://mp.weixin.qq.com/s?__biz=MjM5NTg0NDE1Mw==&mid=2652628269&idx=2&sn=318a825c50d91868315ae83a5fae6605
FAA投入8.75亿美元打造AI空管系统,预计9月21日首秀
美国联邦航空管理局(FAA)的SMART空管系统将利用AI模型预测空中交通流量,基于航空公司时刻表、天气、机场容量、空域条件等因素识别潜在冲突,预计于2026年9月21日率先在华盛顿特区三大机场投入试运行,后续将推广至全美2900万平方英里的空域。该系统总投入达8.75亿美元,是FAA推进空管智能化的核心项目。曾在FAA任职17年的航空安全与AI治理顾问Philip Mann认为,先在小范围场景试运行再推广至全国是“正确的决策”。 来源:https://arstechnica.com/ai/2026/09/faa-tees-up-875m-ai-tool-to-help-manage-air-traffic-congestion/
Anthropic与埃森哲合作投入10亿美元布局前沿AI独立评估
Anthropic与埃森哲达成合作,共同开展前沿AI模型的独立评估工作,双方预计未来5年在该领域投入至少10亿美元,用于建设独立的AI评估能力。该合作是Anthropic近期推动在内部嵌入评估人员、提升AI安全评估透明度的延伸举措。 来源:https://www.anthropic.com/news/accenture-embedded-evaluation
AI安全与风险事件
美军情报因AI幻觉误判中国商船运核部件,几乎触发军事冲突
据CNN报道,美国特种作战司令部一名分析师提交了一份由AI工具生成的完全错误的情报报告,称一艘中国商船正在中东运输核武器计划相关部件。美军原计划出动空中支援拦截并登船检查,最终在行动前发现生成报告的聊天机器人错误识别了商船运载的货物,行动被取消。知情人士称该事件“几乎引发战争”,目前事件细节仍在调查中。 来源:https://arstechnica.com/ai/2026/09/report-us-almost-boarded-chinese-ship-over-hallucinated-ai-arms-report/
研究者利用Claude攻破OpenAI系统,暴露前沿AI安全漏洞
一支网络安全研究团队使用Anthropic的Claude工具攻破了OpenAI的系统,获取了一名OpenAI员工ChatGPT账户的访问权限,可读取私有软件信息并提出修改建议。该团队是通过Anthropic面向安全专业人员提供的漏洞奖励计划工具获得相关权限,该事件凸显了头部AI公司在系统安全防护上的漏洞,引发对 frontier AI 安全性的进一步审视。 来源:https://arstechnica.com/ai/2026/09/researchers-used-claude-to-hack-openai/
论文提出“语言不可读性”概念,指出LLM安全机制存在根本缺陷
arXiv最新发表的论文提出“语言不可读性”概念,指LLM的外部化语言输出或机制提取的语言特征无法准确反映模型的内部实际计算过程。论文认为,只要LLM的内部计算是激活空间上的数学运算而非直接的语言表达,语言不可读性就无法避免,因此依赖语言自我报告的安全机制(如思维链监控、宪法自我审查、语言特征激活探测)永远无法完全可靠,模型沙箱必须采用不依赖读取模型语言状态的隔离技术。论文提出污点追踪是可行的沙箱方案,可预先定义不受模型输出影响的系统状态,同时建议 robust 虚拟化、第三方沙箱配置审计等机制作为补充,可缓解近期 frontier 模型的沙箱利用漏洞。 来源:https://arxiv.org/abs/2609.02852
MIT Technology Review回应AI安全热点问题:不存在AI灭世现实场景
MIT Technology Review举办订阅者专属直播活动,回应“AI是否会杀死全人类”的热点问题,整理了 attendees 提交的相关疑问并给出解答:目前AI已造成少量人员死亡,包括乌克兰战场上的AI无人机袭击、针对医院的AI网络攻击等,但不存在AI杀死全人类的现实场景。部分AI灾难论者的预测在过去几年中准确率较高,需要保持警惕,但过度 catastrophizing 会掩盖AI技术现有的更紧迫问题。 来源:https://www.technologyreview.com/2026/09/18/1144435/could-ai-really-kill-us-all-your-questions-answered/
技术研究突破
Anthropic优化30余个生物模型,蛋白质设计成本最高降98%
Anthropic 9月17日公布Claude优化生物分子建模开源模型的研究结果,不到4周时间优化了30余个用于生物研究的开源深度学习模型,覆盖蛋白结构预测、蛋白设计、蛋白质语言模型、基因组学等任务。在允许极小精度损失的情况下,这批模型平均提速约4倍;若要求输出结果完全一致,平均仍能实现约1.6倍加速。Anthropic开发了自定义kernel FlashPairformer,专门加速蛋白结构预测中的triangle attention和triangle multiplication操作,相较NVIDIA cuEquivariance,triangle attention平均快2.7-2.9倍,triangle multiplication快1.7-3.2倍。优化后大型生物分子系统可在单张NVIDIA GPU节点运行,自研的Big mode可准确预测超1万Token的生物分子系统,超7万Token的系统可完成推理,测试对象包括人类线粒体复合物I、TRiC伴侣蛋白复合物等。此前单个靶点的蛋白设计最多消耗约1万美元算力(约2500张H100 GPU小时),优化后成本最高降98%。相关优化代码已全部开源,由两名有生物分子建模经验但无推理优化背景的Anthropic技术人员监督完成。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3NDkyMTQ5Mw==&mid=2247501886&idx=1&sn=550801a1b1cda7207eebba4a1b420abe
开发者从零手写工具调用LLM,分享完整训练经验
一名开发者从零开始、仅使用单GPU和PyTorch框架,耗时3周训练出2500万参数的开放源码LLM Pebble,该模型支持工具调用(如调用计算器、天气API)。作者发布了完整的实践指南,无抽象类比,覆盖分词器、Transformer架构、训练循环、对齐、部署的全流程细节,可直接复现。作者表示该模型的性能无法与GPT-5等商用大模型相比,但可作为理解现代LLM工作原理的实践参考,填补了入门教程与生产级框架之间的空白。 来源:https://pub.towardsai.net/i-built-a-tool-calling-llm-from-absolute-zero-heres-everything-i-learned-bad8ece610d3?source=rss----98111c9905da---4
暂无评论。