AI新模型四连发,AGI要来了吗?丨科创要闻

Anthropic、OpenAI、Meta、谷歌发布新模型,Runway发布实时界面世界模型,英伟达以35亿美元投资联发科,戴森推出可视成像牙刷CameraJet,特斯拉无人驾驶电动车Cybercab投入运营,美国FDA批准全球首款亚历山大病新药上市,基因编辑猪肾桥接人肾移植成功,虚拟细胞模型State发布,美国启动“铸造学院”,GoPro卖身,尼得科公司认定844起造假事件

责任编辑:黄金萍

科创要闻2026年第35期

2026年8月31日-9月6日

本期要闻汇总人:丁莉

2026年9月1日-3日,四家美国AI龙头企业接连发布了四款大模型。

9月1日,Anthropic推出Fable 5.1,进一步强化了智能体的能力。相比上一代,它更擅长处理持续时间较长、步骤较多的复杂任务,比如连续数小时完成编程、研究和知识工作,并自主验证结果、调整优先级,减少中途“跑偏”或只完成表面工作的情况。Fable 5.1多项基准测试的表现均优于竞争对手OpenAI的GPT-5.6 Sol。

9月2日,谷歌上线了Gemini 3.8 Flash,主攻长周期软件工程和自主Agent,能够反复调用工具、独立完成持续数小时的复杂工作。在测试长程软件工程能力的 DeepSWE v1.1中,Gemini 3.8 Flash拿到73.7%的成绩,相比3.7 Flash提高了约8个百分点;在金融、法律等专业Agent场景中反超了Claude Opus 5。

同日,Meta发布Muse Spark 1.3,在智能体和编码任务方面性能有所提升,并增强了长周期任务、多任务处理及复杂指令遵循的能力。与上一代相比,Muse Spark 1.3在编码任务中调用工具的次数减少约20%,Token的使用量减少约25%,同时增强了对抗性输入和提示注入防护能力。

9月3日,OpenAI发布GPT-6 Astra,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作方面均达到当前最先进水平。在代表高阶数学能力的FrontierMath Tier 4上,Astra得分达到97.6%,几乎将这套研究级数学测试“打穿”;在强调陌生环境学习和抽象推理的ARC-AGI-3上,其成绩更是从GPT-5.6 Sol的7.8%跃升至99.9%,接近满分。

Provider Adapter框架是Astra取得高分的重要原因,它允许模型在多次调用之间保留模型的隐藏推理状态(即隐藏的思维链),复用此前的探索结果。

四巨头一周之内接连亮剑,核心能力提升都在Agent方面,范式从让AI回答问题变成让AI完成工作。

在GPT-6 Astra模型发布时,OpenAI总裁格雷格·布洛克曼(Greg Brockman)宣称“AGI时代已来”。但事实果真如此吗?

ARC Prize指出了Astra高分背后的代价和局限,Astra使用标准测试框架时得分62.7%,测试成本约2.61万美元;使用Provider Adapter框架后,最高得分才达到99.9%,成本约1.88万美元。也就是说,高分仍严重依赖于豪华外挂和昂贵算力。ARC-AGI-3本身也存在范围狭窄、格式固定、机制确定等局限性,并不能代表真实世界的复杂性和开放性。

数字智能

01 Runway发布实时界面世界模型

8月31日,美国AI视频生成公司Runway发布研究项目Solaris,并把它定位为首个Interface World Model(界面世界模型)。其核心理念是,使界面不再

登录后获取更多权限

立即登录

校对:赵立宇

欢迎分享、点赞与留言。本作品的版权为南方周末或相关著作权人所有,任何第三方未经授权,不得转载,否则即为侵权。

{{ isview_popup.firstLine }}{{ isview_popup.highlight }}

{{ isview_popup.secondLine }}

{{ isview_popup.buttonText }}