Astra 在 Stargate Texas 用 10 万块 GPU 完成训练,创 10 亿美元级训练纪录
Emad Mostaque 称 Astra 在 Stargate Texas 使用 10 万块 GPU,耗时约两个月完成预训练,成为首个 10 亿美元规模的训练 run。这一事件标志着大规模 AI 训练的新里程碑,也引发对算力投入与模型能力的讨论。
- Astra 使用 10 万块 GPU 完成预训练
- 训练耗时约两个月
人工智能、AI Agent、大模型、开源模型、AI 产品、模型服务与生态变化。
今日 AI 领域迎来重磅消息:OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,多项基准刷新纪录并首次达到关键级网络安全门槛;NVIDIA 宣布以约 129.3 亿美元收购开源 AI 平台 Hugging Face,引发对开放模型生态的广泛讨论。此外,蚂蚁开源金融模型、Meta 发布图像模型等动态也值得关注。
Emad Mostaque 称 Astra 在 Stargate Texas 使用 10 万块 GPU,耗时约两个月完成预训练,成为首个 10 亿美元规模的训练 run。这一事件标志着大规模 AI 训练的新里程碑,也引发对算力投入与模型能力的讨论。
Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,印证其近十年主张。但他同时指出模型在鲁棒性和可监控性方面仍存疑,引发对 AI 安全与可靠性的讨论。
Anthropic 团队正在探索扩展和自定义 Claude Code 的新方式:Function Hooks,并发布演示视频展示其用途。该功能尚未发布,团队在 GitHub issue 上征集反馈,开发者可参与设计。
Armature公司对Claude Code、Codex和Cursor进行了近1.7万次编码代理会话测试,观察这些AI代理在开发者询问工具时会推荐哪些产品。研究显示,AI代理的工具推荐正成为开发者工具分发的新渠道,未来可能出现围绕代理推荐位的SEO/SEA式竞争,改变开发者工具的推广和商业化模式。
Emad Mostaque 引用 GPT-6 Astra 在 Artificial Analysis 智能指数上因极高 token 效率处于帕累托前沿、每任务成本低于比其便宜 13 倍的 Gemini 3.8 Flash 的对比,预测明年前沿模型将以比现在快且便宜 100 倍的方式 one shot 完成一切。他认为届时无需监控推理痕迹,是本能式智能,因此预训练中嵌入的内容更加重要。
Anthropic 的 Claude Devs 团队宣布在 ant CLI 中新增 `ant apply` 命令。用户可以在仓库中以文件形式声明 Claude Managed Agent 的环境、智能体、技能、记忆存储和部署,并通过 `ant apply` 让 API 资源与这些文件保持同步。
ChatGPT、Claude、Codex 和 Grok 在同一时间窗口内出现服务中断,OpenAI 和 Anthropic 均确认错误率升高。此次多平台同时故障引发对 AI 服务稳定性和基础设施依赖的关注。
OpenAI 宣布,付费 ChatGPT 计划用户每有一天无法访问 Astra,将获得一次 banked reset 补偿。首批补偿约 3 小时后发放,团队正加紧开放访问,未注册用户仍可创建账号。
法国 ISC 商学院研究人员在《应用认知心理学》发表研究,采访 45 名每天使用 ChatGPT 的 18-25 岁用户,发现过度依赖可能与独立思考能力下降、自我怀疑增加和社交孤立相关,并将其与认知卸载联系起来。
Cognition宣布GPT-6 Astra将接入其AI编程工具Devin,在FrontierCode 1.1基准测试中得分与Fable 5相差不到0.4分,同时成本降低64%。该模型还在内部测试基准上创造SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据,显示编码AI在性价比上的显著进步。
SemiAnalysis分析认为,OpenAI投入数亿美元研发ASIC芯片Jalapeno并在Hot Chips展示,主要目的是向NVIDIA施压,以换取数十亿美元级别的融资和担保。如果Jalapeno规模化表现出色,OpenAI每MW收入将提升;即使芯片失败,OpenAI仍能从NVIDIA获得大量融资和担保,策略上进退有据。
OpenAI 宣布推出 Daybreak for Frontline Defenders 计划,投入 10 亿美元(约 67.36 亿元人民币),为资源有限的网络安全防御团队提供 Daybreak 访问权限、培训、技术支持及合作服务,优先覆盖供水、电力、地方政府和金融等关键服务。
沃顿商学院教授Ethan Mollick提出,使用Fable和Astra这类高级AI模型的心智模型应是委派给一个优秀的外部团队,而非实习生。他强调用户需要清晰表达目标、赋予AI适当自主权、指定测试内容及求助时机,并能描述期望成果,以充分发挥高级模型的能力。
作者数字生命卡兹克发布对 GPT-6 Astra 的全面解析,标题以"欢迎来到AGI时代"点题。当前材料仅提供摘要级信息,正文以"一段渐变的旅程"描述,未给出可验证的具体细节。
洛杉矶联合学区已在学区设备上对所有学生封禁生成式AI,Google Search仍可用但AI Mode已禁用,AI Overviews仍可能出现,因Google未提供完全关闭开关。教师使用AI不受限。同时纽约市暂停八年级以下学生-facing AI,显示教育领域对生成式AI的谨慎态度。
Google的Gemini Live功能现已支持Google Workspace连接器,包括Gmail、Keep和Docs。这一更新使用户能在对话中直接访问和处理工作区内容,是Gemini Live功能的重要扩展,提升了AI助手的实用性和集成度。
一项研究提示,用于全科医生记录咨询的AI笔记工具可能遗漏重要信息,如患者的面部表情或情绪状态。这些工具虽能记录对话,但无法捕捉非语言线索,可能影响诊断准确性。研究呼吁关注AI在医疗场景中的局限性。
ARC Prize 分析显示,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上,标准框架得分 62.7%,但通过新的 Provider Adapter 框架提升至 99.9%,并在 96% 的关卡上超越人类表现。这一成绩标志着该基准已接近饱和,引发对下一代基准的讨论。
OpenAI于9月3日发布新一代大语言模型GPT-6 Astra,这是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。该发布标志着AI在网络安全领域的能力达到新高度,同时也引发对安全风险的关注。
OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,这是其首个达到准备框架中关键级网络安全能力门槛的模型,能够在无逐步指导的情况下发现防护严密系统的未知漏洞,标志着 AI 在网络安全领域的重大进展。
ARC Prize 相关作者转发消息称 ARC-AGI 3 基准现已饱和,并强调需要尽快推出新的基准。这一声明紧随 GPT-6 Astra 在基准上取得高分之后,反映出当前 AI 评测体系面临更新需求。
AI研究者Elvis Saravia对GPT-6 Astra发布当天未获得使用权限表示失望,并对比Fable 5.1发布日即可使用的情况,调侃希望AGI不会以这种方式发布。这一对比反映了业界对OpenAI发布策略的不满,以及对模型可用性的期待。
职业建筑师 ZHO 评价 GPT-6 Astra 的惊艳点在于通过建模/渲染软件实现高质量 3D 建模和渲染,但认为这并不惊艳,早在 2023 年就提出 AI 能生成真实照片后就不再需要效果图。他认为如果 GPT-6 足够强,应重建全新工作逻辑,而非更好地完成旧链路。
Greg Brockman转发ARC Prize评测称,OpenAI的GPT-6 Astra在ARC-AGI-3基准上取得SOTA,标准harness得分63%,经新Provider Adapter harness达99%,在96%的关卡上超越人类表现。排行榜显示更高推理层级通常成本更低,因Astra用更少动作通关,减少模型调用和token数。
OpenAI 联合创始人 Greg Brockman 转发 ARC Prize 评测,称 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,标准 harness 得分 63%,经新 Provider Adapter harness 达 99%,在 96% 关卡超越人类。他称该基准已饱和,并指出更高推理层级成本更低。
OpenAI 员工 Sherwin Wu 发帖称,GPT-5.6 Luna 已悄然登顶 OpenRouter 榜单,成为长时间以来首个登顶的闭源模型。该模型本周用量达 11.6T tokens,环比上涨 183%,价格与性能组合出色,引发社区关注。
xAI 发布 Grok Bot for Enterprise,未来两周对 Grok 和 Cursor 企业客户免费。官方称部署 Bot 体验如同让公司入职数千名能干的同事,是内部采用最广、能力最强的 AI 产品。已有数千组织采用,创建数百万 Bot。
Perplexity CEO 表示 Astra 在 computer use 方面表现出色,将把它带到 Comet 以及支撑所有 computer 使用的云端浏览器沙箱,Evals 即将推出。
Grok Bot for Enterprise 发布,Grok 和 Cursor Enterprise 客户可免费试用两周,并邀请整个组织成员参与,包括无席位者。近几周已有数千个组织采用,创建数百万个 Bot。
OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口和 128,000 最大输出 token。在 OSWorld V2-Offline 基准上得分 72.6%,平均任务时间从 75 分钟降至 40 分钟。因触及关键网络安全阈值,访问受限。
OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 105 万 token 上下文窗口和 12.8 万最大输出 token,OSWorld V2-Offline 得分 72.6%,平均任务时间从 75 分钟降至 40 分钟。因触及关键网络安全阈值,访问受限。
swyx 转发 latent.space 对 OpenAI Astra 的实测:团队用超 20B token 将 Astra 投入各类 AI 工程任务,验证其能力,成本低于每小时 $6,展示其在实际工程中的性价比。
Google 宣布推出 Google Labs 新实验 Play with Putty,目前通过候补名单面向美国用户开放。该产品定位为协作式 vibe coding 工具,支持用户实时共同构建工具和网站。
Cognition 宣布 GPT-6 Astra 即将登陆 AI 编程工具 Devin。在 FrontierCode 1.1 基准上,Astra 表现与 Fable 5 相差 0.4 分以内,但成本降低 64%,并在内部测试中创下 SOTA,生成更全面的测试和报告。
Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益。Perplexity 将很快向 Computer 的 Pro 和 Max 用户开放 Astra。
Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。
Perplexity 发布对 GPT-6 Astra 的评测结果,在 WANDR 基准上得分 0.682 位居榜首,单任务成本为 11.98 美元。该评测展示了 GPT-6 Astra 在复杂任务上的性能与成本平衡,为 AI 模型评估提供了新数据。
GPT-6 Astra 在 Mercor 的 APEX-Agents 排行榜首次上榜即排名第一,Mean score 62.4%(第1),Pass@1 46.7%(第2),在法律、金融等咨询任务上表现全面提升,展示了其在专业领域的强大能力。
Any Human Ever 是一个网页项目,号称从所有曾活过的人中随机抽取一位,用人口统计、历史地理和LLM补全其人生细节。但评论指出其使用对数坐标易误导概率,且引用系统出现Claude补缺,不少细节并非严格史料,被质疑将统计、历史叙事与AI幻觉混为一谈。
TestingCatalog 转述 OpenAI 宣布 Defense Factory,一个依赖前沿模型的持续防御概念,指自动化的防御运营,用于持续发现、验证和修复漏洞,并引入"防御者窗口"理念。
论文《Act More, Decide Less》提出 SPACE 方法,从成功轨迹归纳两级程序化技能,用子技能边界监督,经混合优化蒸馏出 primitive-chunk 策略,使长程 Agent 减少 78.9% 的 LLM 调用。
OpenAI 发布 GPT-6 Astra 在 ARC-AGI-3 上的表现,引发关于评分、推理成本和 AGI 定义的讨论。评论质疑 benchmark 是否能代表智能,并探讨模型在未见任务上的泛化能力。
Rohan Paul 梳理 OpenAI GPT-6 Astra 117 页系统卡要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,但可监控性相应下降。这一安全特性变化引发对模型自主性与可控性平衡的讨论。
Rohan Paul 梳理 OpenAI GPT-6 Astra 117 页系统卡要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,但可监控性相应下降,引发对安全与可控性的讨论。
有消息称 NVIDIA 收购了 Hugging Face,作者预期未来两家公司将推出紧密集成一体的 AI 基础设施,并期待 from_pretrained() 等接口能带来最流畅的体验。该消息若属实,将深刻影响 AI 开源生态和基础设施格局。
Charlie Holtz 发布 Cloud Desktop,一种与云机器交互的新方式,让云机器用起来像 localhost。用户可以观看智能体工作,并在需要时随时接管控制,提升云开发体验。
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》,提出 Declarative Attention 方法,让模型在推理过程中自行控制注意力范围,以减少 KV cache 读取,提升效率。
Charlie Holtz 转发并附议 Ethan Mollick 的观点,指出多人协作式 AI,即组织中多人共同使用 AI 完成目标,是当前 AI 应用中最重要的非技术问题之一。Mollick 认为现有方案仍很原始,多基于把 AI 当作群聊成员的思路,存在局限。
ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 上的表现:标准 harness 得分 63%,经新 provider adapter harness 可达 99%,并在 96% 关卡上动作效率超过受测人类中位数。模型能将陌生环境转化为符号世界模型,展现强大推理能力。
作者点评 OpenAI 新发布的基础模型 GPT-6-Astra,认为基准显示其在浏览器操作、计算机操作、Excel、编码、药物发现、数学研究等领域达到专家水平,Sam Altman 和 Greg Brockman 称其可能接近 AGI。
KAIST AI 与 Google DeepMind 等机构发布论文《Language Models Can Control Their Own Attention》,提出 Declarative Attention 方法,使语言模型在链式推理中能够自行控制注意力范围。该研究或为提升模型推理效率和可解释性提供新思路。
ZHO 发起 GPT-6 Astra 案例合集帖,转引他人视频演示建筑设计全流程:从平面图设计、Blender 建模到 UE5 渲染与建筑漫游视频,并包含细节细化。作者认为前期概念方案可由 GPT-6 完成,展示其在创意设计领域的应用潜力。
AI 领域知名博主 ZHO 在看完 GPT-6 Astra 官方文章后表示无感,认为文中展示的案例缺乏想象力,多基于现有场景的惯性思维。他催促 OpenAI 尽快开放测试,认为如果模型能力真的强大,应有更具突破性的展示方式。
TestingCatalog 转发 Sam Altman 推文,Altman 表示博客部署遇到小问题但内容很棒,并给出 GPT-6 Astra 官方介绍链接。该消息侧面印证了 GPT-6 Astra 的发布进程,并透露了发布过程中的一些细节。
HojoAI 的 Hojo-ASR-Multi-V1 正式上线 Open ASR Leaderboard,全球排名第 7,开源多语言 ASR 中排名第 1,五语言平均 WER 3.54%。该模型展示了开源语音识别技术的显著进步。
GPT-6 Astra 在 75 分钟内根据同一提示词构建出浏览器版 macOS 模拟器,支持 cloud sync 和可用应用。引用者称这是他见过最好的输出,展示了 GPT-6 Astra 在复杂代码生成和产品构建方面的强大能力。
Sherwin Wu 表示 ARC-AGI-3 基准已被 GPT-6 Astra 饱和。François Chollet 透露,ARC 3 发布时预计前沿模型约一年才能饱和,实际仅用 6 个月,约为预期的 2 倍速度。新一代模型能力将挑战人们基于旧模型形成的 AI 观点。
据 Sherwin Wu 引用 François Chollet 的观点,ARC-AGI-3 基准发布时预计前沿模型约需一年才能饱和,但 GPT-6 Astra 仅用 6 个月便达到饱和,速度约为预期的两倍。这一进展表明新一代模型能力提升迅速,或将挑战人们基于旧模型形成的 AI 认知。
OpenAI 正式发布 GPT-6 Astra,官方宣布其在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 等多项基准测试中达到 SOTA 水平,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。这是 OpenAI 在 AI 模型能力上的又一次重大更新。
OpenAI 正式发布新一代模型 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 等多项基准测试中达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。该模型被视为 AI 能力的重要跃升,引发社区广泛关注。