Anthropic公开3万Agent研发下一代Claude核心数据【AI早报2026-09【AI 早报 2026-09-19】

Anthropic公开3万Agent研发下一代Claude核心数据【AI早报2026-09【AI 早报 2026-09-19】

今日AI领域技术落地与治理进展并行:达摩院通用医疗影像AI登顶《科学》并开源,Qwen发布全模态Agent模型,PrismML推出5.9GB三进制大模型,Anthropic首次公开3万Agent自研Claude的核心运营数据,同时Jina AI、OpenAI等分别推出垂直场景模型与工具,行业持续聚焦模型效率、多模态能力与安全可控。

今日概览

  1. 有望对标Databricks,OceanBase押注AI数据底座的万亿市场
  2. 从零搭建工具调用LLM全流程指南:我花三周构建Pebble模型的全部经验
  3. GGUF、GPTQ、AWQ、EXL2:2026年大模型格式完全解析
  4. 全球首个专家级通用医疗影像AI登上Science,达摩院DAMO RADAR宣布开源
  5. PrismML发布三进制Bonsai 2 27B:5.9GB模型保留Qwen3.8 27B 98.2%性能
  6. 全模态模型Qwen3.8-Omni-Flash正式发布
  7. Jina AI发布jina-ocr-v1:低成本GPU上更快解析文档
  8. ChatGPT发明者推出新型AI模型Jev,开发者反响热烈
  9. Anthropic公开3万Agent研发下一代Claude核心数据:26%研发工作由AI主导
  10. OpenAI推出法律领域专用模型Astra for Law
  11. Anthropic与埃森哲合作开展前沿AI独立评估,五年投资至少10亿美元
  12. Claude Code 2.1.277版本新增AGENTS.md支持,无CLAUDE.md时自动适配
  13. 研究人员利用Claude工具成功入侵OpenAI系统,发现ChatGPT安全漏洞
  14. AI竞赛安全研究:八组实验探索2026-2034年技术可控性

大模型与产品

全球首个专家级通用医疗影像AI登上Science,达摩院DAMO RADAR宣布开源

阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上国际顶级学术期刊《科学》,面向腹部增强CT诊断,可一次性识别超过146种病症,平均AUC达到0.913,首次达到影像科专家水平,现已正式开源。模型采用国际首次提出的“器官级细粒度对齐”技术,将三维CT拆分为单个器官后让影像与报告精准匹配,配合自适应对比建模,无需增加人工标注即可支持更多诊断任务。在近4万次真实检查中,模型AUC达0.913,与26名影像科医生对比时平均准确率超过其中23名;在AI提示下,放射科医生识别疾病的敏感性提升10%,用时减少30%以上,低年资医生可达到高年资医生的诊断水平,急腹症识别AUC达0.904,未见过的急诊场景表现稳定。 来源:https://mp.weixin.qq.com/s?__biz=MjM5NTg0NDE1Mw==&mid=2652628269&idx=2&sn=318a825c50d91868315ae83a5fae6605

全模态模型Qwen3.8-Omni-Flash正式发布

阿里巴巴发布新一代原生全模态模型Qwen3.8-Omni-Flash,核心目标是提升真实生产力场景中的Agent能力,推动全模态模型从内容理解走向任务规划、工具调用与创作交付,支持文本、图像、音频、视频输入及1M长上下文。相比上一代Qwen3.5-Omni-Plus,模型在累计30项评测上平均得分提升超过26%,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench得分69.6;音视频能力接近Gemini 3.8 Flash,音频能力整体超过该模型。API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。模型开源Qwen-MM-Plugins与Qwen-Live Harness,分别支持长音视频按需感知、工具调用、工作流执行和实时全模态交互;Agentic Understanding在OmniVideoBench上准确率从63.4提升至67.8,Token消耗从145736降至79117,降幅45.7%,多说话人识别任务中AliMeeting的DER从88.11降至3.35,cpWER从89.61降至17.18。 来源:https://mp.weixin.qq.com/s?__biz=MjM5NTg0NDE1Mw==&mid=2652628269&idx=1&sn=1ee2ce1720d33f4a7643f712eaf341c9

PrismML发布三进制Bonsai 2 27B:5.9GB模型保留Qwen3.8 27B 98.2%性能

PrismML发布三进制权重版本的Qwen3.8 27B模型Ternary Bonsai 2 27B,整体体积5.93GB,远小于FP16版本的53.80GB,保留父模型20项基准平均性能的98.2%,采用Apache 2.0协议,支持文本、图像输入及262K token上下文,可在16GB笔记本或24GB单GPU上部署,需使用PrismML的llama.cpp分支或MLX运行时。模型总参数27.36B,其中仅0.0976%(26.2M)保持高精度,为循环状态路径和归一化权重,其余权重采用三进制(-1、0、+1),每128个权重共享1个FP16缩放因子,每权重约1.71比特,提供两种GGUF打包方案:PTQ1_0为1.76比特每权重(5.93GB),PQ2_0为2比特每权重(7.25GB),部署成本更低。模型已在RTX 5090上演示驱动Cline编程Agent和计算机操作,第二版三进制模型相比首版Bonsai 27B的性能保留率从95%提升至98.2%。 来源:https://www.marktechpost.com/2026/09/18/prismml-releases-ternary-bonsai-2-27b-a-5-9-gb-apache-2-0-model-retaining-98-2-of-qwen3-8-27b-performance/

Jina AI发布jina-ocr-v1:低成本GPU上更快解析文档

Jina AI发布总参数3.4B的端到端文档解析模型jina-ocr-v1,解码时每Token仅激活570M参数,在OmniDocBench v1.6上得分91.14,在olmOCR-Bench上得分83.4,刷新同级别最佳成绩,14款主流端到端系统吞吐实测中以2.57页/秒领跑。模型采用FastMTP推测解码技术,通过单个共享dense块递归前向K=3步生成候选token,参数量与前瞻深度解耦,在单张NVIDIA L4低成本显卡上生成速度几乎翻倍,且输出与标准自回归解码严格一致、完全无损;后训练采用Dense Verifiable Rewards(GRPO)技术,按部分正确程度分级给分,仅靠后训练改进就在olmOCR-Bench上提升7.4分。视觉编码器DeepEncoder将1024×1024画面从4096个Patch压缩至256个Token,单Token承载3887像素,大幅降低多模态Prefill阶段计算与KV Cache占用;单张A100、并发32场景下,生成速度达2792 tokens/s,单页输出1085 tokens,端到端吞吐2.57页/秒。预训练语料混合了主流公开OCR数据集,补充了Europeana历史报纸、美国国会图书馆缩微文献等高难度真实排版源。 来源:https://mp.weixin.qq.com/s?__biz=MzkyODIxMjczMA==&mid=2247503626&idx=1&sn=8b4cd6a8470c0ac7a4bca09f3ab1425f

ChatGPT发明者推出新型AI模型Jev,开发者反响热烈

由ChatGPT发明者推出的新型AI模型Jev,目前正在向开发者展示一条成本更低、速度更快的软件智能实现路径,具体技术细节与性能参数尚未完全公开。 来源:https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/

行业动态与商业

有望对标Databricks,OceanBase押注AI数据底座的万亿市场

IDC最新研究重新划定了“AI数据基础设施”的市场边界,预测中国市场将从2025年的约149亿美元增长至2030年的738亿美元,2025年至2030年复合增长率37.7%,到2035年有望达到约1万亿人民币规模。企业AI落地正从通用大模型调用转向“小模型微调+多模态底座”模式,核心瓶颈在于数据层的统一管理、实时检索、语义理解与安全合规,多模态数据底座成为必选项。OceanBase于2026年6月29日发布湖库一体AI数据库Lakebase,将数据湖的开放存储能力、数据库的事务处理分析能力与多模态数据处理能力统一到一套架构中,为AI应用和Agent提供统一数据基础,同时面向Agent场景提供数据沙箱,支持大规模生产级Agent基于真实数据运行。 来源:https://mp.weixin.qq.com/s?__biz=MzA4MTQ4NjQzMw==&mid=2652810608&idx=1&sn=f7dbe8098a2463c2df660605c25981db

OpenAI推出法律领域专用模型Astra for Law

OpenAI推出法律领域专用模型Astra for Law,基于其GPT-6 Astra模型针对法律工作场景进行优化,正式进军法律科技市场。 来源:https://the-decoder.com/openai-takes-aim-at-the-legal-market-with-astra-for-law/

Anthropic与埃森哲合作开展前沿AI独立评估,五年投资至少10亿美元

Anthropic与埃森哲达成合作,共同开展前沿AI的独立评估工作,这是Anthropic近期承诺将评估人员嵌入自身运营的部分实践,双方预计未来五年在该领域投资至少10亿美元,用于建设相关评估能力。 来源:https://www.anthropic.com/news/accenture-embedded-evaluation

技术研究与工具

从零搭建工具调用LLM全流程指南:我花三周构建Pebble模型的全部经验

一名开发者发布从零搭建工具调用大语言模型的完整指南,耗时3周、仅用单张GPU,无HuggingFace、微调封装等现成框架依赖,仅用PyTorch从随机初始化开始,最终开源了2500万参数的工具调用模型Pebble,支持调用计算器、天气API等工具,能力与GPT-4、Claude的工具调用逻辑一致。教程完整覆盖tokenizer、Transformer架构、训练循环、对齐、部署全流程,无模糊类比,所有代码与实现细节均可复现,旨在填补现有LLM教学资料中“基础原理”与“生产框架”之间的空白。 来源:https://pub.towardsai.net/i-built-a-tool-calling-llm-from-absolute-zero-heres-everything-i-learned-bad8ece610d3?source=rss----98111c9905da---4

GGUF、GPTQ、AWQ、EXL2:2026年大模型格式完全解析

2026年大模型格式科普文章区分了“容器(存储格式)”与“量化方法”两个易混淆的概念:容器定义张量在磁盘上的存储方式,包括safetensors、GGUF、PyTorch pickle(.bin/.pt);量化方法定义权重的压缩方式,包括GPTQ、AWQ、bitsandbytes NF4、llama.cpp K-quants和I-quants;EXL2和EXL3则是量化方法与存储布局绑定的方案,仅适用于特定推理库。模型内存估算公式为:内存≈参数量×每权重比特数÷8,仅计算权重部分,KV Cache与运行时开销需额外计算,例如8B参数模型16-bit版本约16GB,4.5-bit量化后约4.5GB;70B模型16-bit约140GB,4.5-bit约39GB。safetensors由Hugging Face推出,无代码执行安全风险,支持内存映射逐张量加载,已成为PyTorch Foundation项目;GGUF是llama.cpp使用的二进制格式,2023年8月21日推出替代旧版GGML,支持单文件部署、可扩展、内存映射,可携带tokenizer、特殊tokens与对话模板,避免添加新超参数时破坏旧文件。 来源:https://www.marktechpost.com/2026/09/18/gguf-vs-gptq-vs-awq-vs-exl2-llm-model-formats-explained-2026/

Claude Code 2.1.277版本新增AGENTS.md支持,无CLAUDE.md时自动适配

Anthropic在Claude Code 2.1.277版本中新增对AGENTS.md文件的支持,当项目文件夹内不存在CLAUDE.md文件时,Claude会自动读取并使用AGENTS.md文件中的规则配置。 来源:https://simonwillison.net/2026/Sep/18/thariq-shihipar/

安全与治理

Anthropic公开3万Agent研发下一代Claude核心数据:26%研发工作由AI主导

Anthropic首次公开AI自我进化的核心运营数据,建立从AL0到AL5的研发自动化分级标准,截至2026年8月的数据显示:Claude完全自主操作的研发比例为0,AI主导的研发工作达26%,AI深度协作及以上级别的工作比例超过90%,绝大部分AI研发离不开AI本身的深度参与。Anthropic内部约30000个AI Agent同时开展研发和工程工作,可半自主运行、互相派发任务,实时监控覆盖率100%,2026年8月分析超过10亿次Agent决策,0.002%的动作被直接拦截,约每47000次操作拦截1次,被拦截动作一周内由人类复核;离线监控覆盖率100%,每周标记约10万份记录,筛选出约50份最高优先级记录交人类安全员复核,整体标记率在千分之一到千分之二之间。2026年7月中旬一周的算力抽样显示,AI研发总算力中安全研究所占约6%,AI自主研发算力中安全研究所占约12%,为保守估算。Anthropic计划引入多家独立第三方机构进驻,开放与内部风控团队相同的系统权限全程监督相关指标。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247519062&idx=1&sn=06eac96ac1876878d586ef266792a968

研究人员利用Claude工具成功入侵OpenAI系统,发现ChatGPT安全漏洞

一支网络安全研究团队使用Anthropic专门为安全专业人员提供的工具,成功入侵了OpenAI一名员工的ChatGPT账户,可读取私有软件信息并提出修改建议,该漏洞属于OpenAI安全体系的一部分。该研究是Anthropic漏洞奖励计划的一部分,研究人员在恶意行为者利用漏洞前发现并上报了该问题,事件凸显了头部AI公司在安全防护方面的潜在风险,目前相关漏洞已被修复。 来源:https://arstechnica.com/ai/2026/09/researchers-used-claude-to-hack-openai/

AI竞赛安全研究:八组实验探索2026-2034年技术可控性

一项AI竞赛安全研究通过八组模拟实验探索2026-2034年AI技术发展的可控路径,核心结论包括:无后果的审计 barely 提升可控性,能力增长速度是检查能力的5倍以上;评估者算力占比从2%提升至29%时,公众算力占比仅维持在2.5%;若单方单独放缓研发,2034年能力值仅为7.7,远低于不放缓的15.6;若安全研究同样获得自动化红利,能力增长8倍时核查能力可保持同步;延迟监管的成本随启动时间推迟而飙升,2026年启动监管的成本为0个未覆盖能力年,2032年启动则升至51个。研究指出,能力技术是共享的,真正改变的是谁控制研究资源的分配,以及安全研究的产出效率。 来源:https://pub.towardsai.net/who-gets-the-brake-295d2ae25e8f?source=rss----98111c9905da---4

评论

暂无评论。

登录后可发表评论。