AI 动态

人工智能、AI Agent、大模型、开源模型、AI 产品、模型服务与生态变化。

Today’s live brief

AI 动态今日快讯:GPT-6 Astra 发布、NVIDIA 收购 Hugging Face

今日 AI 领域迎来重磅消息:OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,多项基准刷新纪录并首次达到关键级网络安全门槛;NVIDIA 宣布以约 129.3 亿美元收购开源 AI 平台 Hugging Face,引发对开放模型生态的广泛讨论。此外,蚂蚁开源金融模型、Meta 发布图像模型等动态也值得关注。

Sep 407:30 AM
AI HOT — 全部 AI 动态AI curated

Astra 在 Stargate Texas 用 10 万块 GPU 完成训练,创 10 亿美元级训练纪录

Emad Mostaque 称 Astra 在 Stargate Texas 使用 10 万块 GPU,耗时约两个月完成预训练,成为首个 10 亿美元规模的训练 run。这一事件标志着大规模 AI 训练的新里程碑,也引发对算力投入与模型能力的讨论。

  • Astra 使用 10 万块 GPU 完成预训练
  • 训练耗时约两个月
Read source
Sep 407:24 AM
AI HOT — 精选AI curated

Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑

Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,印证其近十年主张。但他同时指出模型在鲁棒性和可监控性方面仍存疑,引发对 AI 安全与可靠性的讨论。

  • GPT-6 Astra 被认为是真正的进步
  • OpenAI 显式创建并操纵符号世界模型
Read source
Sep 407:19 AM
AI HOT — 全部 AI 动态AI curated

Anthropic 探索为 Claude Code 推出 Function Hooks,公开征求反馈

Anthropic 团队正在探索扩展和自定义 Claude Code 的新方式:Function Hooks,并发布演示视频展示其用途。该功能尚未发布,团队在 GitHub issue 上征集反馈,开发者可参与设计。

  • Anthropic 探索 Claude Code 的 Function Hooks
  • 功能尚未发布,处于反馈征集阶段
Read source
Sep 407:19 AM
News Hacker | 极客洞察AI curated

Claude/Codex/Cursor 1.7万次实测:工具推荐位成开发者工具新战场

Armature公司对Claude Code、Codex和Cursor进行了近1.7万次编码代理会话测试,观察这些AI代理在开发者询问工具时会推荐哪些产品。研究显示,AI代理的工具推荐正成为开发者工具分发的新渠道,未来可能出现围绕代理推荐位的SEO/SEA式竞争,改变开发者工具的推广和商业化模式。

  • Armature对1.7万次编码代理会话进行实测
  • 研究AI代理如何选择推荐开发工具
Read source
Sep 407:16 AM
AI HOT — 全部 AI 动态AI curated

Emad Mostaque 预测前沿模型明年将以百倍速度与成本优势一键完成任务

Emad Mostaque 引用 GPT-6 Astra 在 Artificial Analysis 智能指数上因极高 token 效率处于帕累托前沿、每任务成本低于比其便宜 13 倍的 Gemini 3.8 Flash 的对比,预测明年前沿模型将以比现在快且便宜 100 倍的方式 one shot 完成一切。他认为届时无需监控推理痕迹,是本能式智能,因此预训练中嵌入的内容更加重要。

  • GPT-6 Astra 在 token 效率上处于帕累托前沿
  • 预测前沿模型将快且便宜 100 倍
Read source
Sep 407:12 AM
AI HOT — 全部 AI 动态AI curated

Anthropic 为 ant CLI 新增 `ant apply`,支持声明式管理 Claude Managed Agent 资源

Anthropic 的 Claude Devs 团队宣布在 ant CLI 中新增 `ant apply` 命令。用户可以在仓库中以文件形式声明 Claude Managed Agent 的环境、智能体、技能、记忆存储和部署,并通过 `ant apply` 让 API 资源与这些文件保持同步。

  • ant CLI 新增 ant apply 命令
  • 支持声明式管理 Claude Managed Agent 资源
Read source
Sep 407:12 AM
AI HOT — 全部 AI 动态AI curated

ChatGPT、Claude、Codex、Grok 同日相继故障,原因尚未完全查明

ChatGPT、Claude、Codex 和 Grok 在同一时间窗口内出现服务中断,OpenAI 和 Anthropic 均确认错误率升高。此次多平台同时故障引发对 AI 服务稳定性和基础设施依赖的关注。

  • 多个主流 AI 服务同日故障
  • OpenAI 和 Anthropic 确认错误率升高
Read source
Sep 407:12 AM
AI HOT — 全部 AI 动态AI curated

ChatGPT 付费用户无法访问 Astra 期间每天可获一次 banked reset 补偿

OpenAI 宣布,付费 ChatGPT 计划用户每有一天无法访问 Astra,将获得一次 banked reset 补偿。首批补偿约 3 小时后发放,团队正加紧开放访问,未注册用户仍可创建账号。

  • 付费用户因 Astra 不可用获得补偿
  • 补偿为每天一次 banked reset
Read source
Sep 407:08 AM
AI HOT — 全部 AI 动态AI curated

研究:过度依赖 ChatGPT 可能降低独立思考能力

法国 ISC 商学院研究人员在《应用认知心理学》发表研究,采访 45 名每天使用 ChatGPT 的 18-25 岁用户,发现过度依赖可能与独立思考能力下降、自我怀疑增加和社交孤立相关,并将其与认知卸载联系起来。

  • 研究对象为 45 名年轻用户
  • 过度依赖与独立思考能力下降相关
Read source
Sep 407:02 AM
AI HOT — 全部 AI 动态AI curated

Cognition:GPT-6 Astra 在 FrontierCode 1.1 上以低64%成本逼近 Fable 5 编码水平

Cognition宣布GPT-6 Astra将接入其AI编程工具Devin,在FrontierCode 1.1基准测试中得分与Fable 5相差不到0.4分,同时成本降低64%。该模型还在内部测试基准上创造SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据,显示编码AI在性价比上的显著进步。

  • GPT-6 Astra接入Devin,编码能力逼近Fable 5
  • 成本降低64%,性价比显著提升
Read source
Sep 407:00 AM
AI HOT — 全部 AI 动态AI curated

SemiAnalysis:OpenAI自研ASIC芯片Jalapeno是对NVIDIA的谈判筹码

SemiAnalysis分析认为,OpenAI投入数亿美元研发ASIC芯片Jalapeno并在Hot Chips展示,主要目的是向NVIDIA施压,以换取数十亿美元级别的融资和担保。如果Jalapeno规模化表现出色,OpenAI每MW收入将提升;即使芯片失败,OpenAI仍能从NVIDIA获得大量融资和担保,策略上进退有据。

  • OpenAI自研ASIC芯片Jalapeno用于谈判
  • 对NVIDIA施压以获取融资和担保
Read source
Sep 406:56 AM
AI HOT — 全部 AI 动态AI curated

OpenAI 投入 10 亿美元推出 Daybreak for Frontline Defenders 计划,扩大 AI 网络安全防御覆盖

OpenAI 宣布推出 Daybreak for Frontline Defenders 计划,投入 10 亿美元(约 67.36 亿元人民币),为资源有限的网络安全防御团队提供 Daybreak 访问权限、培训、技术支持及合作服务,优先覆盖供水、电力、地方政府和金融等关键服务。

  • 投入 10 亿美元支持网络安全防御
  • 提供 Daybreak 访问权限和培训
Read source
Sep 406:48 AM
AI HOT — 全部 AI 动态AI curated

Ethan Mollick:使用Fable和Astra级模型应像委派给优秀外部团队

沃顿商学院教授Ethan Mollick提出,使用Fable和Astra这类高级AI模型的心智模型应是委派给一个优秀的外部团队,而非实习生。他强调用户需要清晰表达目标、赋予AI适当自主权、指定测试内容及求助时机,并能描述期望成果,以充分发挥高级模型的能力。

  • 高级AI模型使用应像委派给优秀团队
  • 需明确目标、自主权和测试要求
Read source
Sep 406:45 AM
AI HOT — 全部 AI 动态AI curated

GPT-6 Astra 全面解析

作者数字生命卡兹克发布对 GPT-6 Astra 的全面解析,标题以"欢迎来到AGI时代"点题。当前材料仅提供摘要级信息,正文以"一段渐变的旅程"描述,未给出可验证的具体细节。

  • 对 GPT-6 Astra 的全面解析
  • 标题强调 AGI 时代到来
Read source
Sep 406:42 AM
AI HOT — 全部 AI 动态AI curated

洛杉矶联合学区封禁学生生成式AI,纽约市暂停八年级以下学生AI

洛杉矶联合学区已在学区设备上对所有学生封禁生成式AI,Google Search仍可用但AI Mode已禁用,AI Overviews仍可能出现,因Google未提供完全关闭开关。教师使用AI不受限。同时纽约市暂停八年级以下学生-facing AI,显示教育领域对生成式AI的谨慎态度。

  • 洛杉矶学区全面封禁学生生成式AI
  • 纽约市暂停低年级学生AI使用
Read source
Sep 406:42 AM
AI HOT — 全部 AI 动态AI curated

Gemini Live 支持 Gmail、Keep 和 Docs 等 Google Workspace 连接器

Google的Gemini Live功能现已支持Google Workspace连接器,包括Gmail、Keep和Docs。这一更新使用户能在对话中直接访问和处理工作区内容,是Gemini Live功能的重要扩展,提升了AI助手的实用性和集成度。

  • Gemini Live新增Workspace连接器
  • 支持Gmail、Keep和Docs
Read source
Sep 406:32 AM
BBC新闻AI curated

研究:AI笔记工具可能遗漏重要信息,如患者面部表情或情绪状态

一项研究提示,用于全科医生记录咨询的AI笔记工具可能遗漏重要信息,如患者的面部表情或情绪状态。这些工具虽能记录对话,但无法捕捉非语言线索,可能影响诊断准确性。研究呼吁关注AI在医疗场景中的局限性。

  • AI笔记工具可能遗漏非语言信息
  • 影响全科医生诊断准确性
Read source
Sep 406:28 AM
AI HOT — 全部 AI 动态AI curated

GPT-6 Astra 在 ARC-AGI-3 基准上达 99.9%,接近饱和

ARC Prize 分析显示,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上,标准框架得分 62.7%,但通过新的 Provider Adapter 框架提升至 99.9%,并在 96% 的关卡上超越人类表现。这一成绩标志着该基准已接近饱和,引发对下一代基准的讨论。

  • GPT-6 Astra 在 ARC-AGI-3 标准框架得分 62.7%
  • Provider Adapter 框架下得分达 99.9%
Read source
Sep 406:28 AM
AI HOT — 精选AI curated

OpenAI 发布 GPT-6 Astra,首个达到关键级网络安全能力门槛的模型

OpenAI于9月3日发布新一代大语言模型GPT-6 Astra,这是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。该发布标志着AI在网络安全领域的能力达到新高度,同时也引发对安全风险的关注。

  • GPT-6 Astra发布,达到关键级网络安全门槛
  • 能自主发现未知漏洞
Read source
Sep 406:28 AM
AI HOT — 全部 AI 动态AI curated

OpenAI 发布 GPT-6 Astra,首个达关键级网络安全门槛的模型

OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,这是其首个达到准备框架中关键级网络安全能力门槛的模型,能够在无逐步指导的情况下发现防护严密系统的未知漏洞,标志着 AI 在网络安全领域的重大进展。

  • GPT-6 Astra 为 OpenAI 新发布的大模型
  • 首个达到关键级网络安全能力门槛
Read source
Sep 406:15 AM
AI HOT — 全部 AI 动态AI curated

ARC-AGI 3 基准宣告饱和,呼吁建立新基准

ARC Prize 相关作者转发消息称 ARC-AGI 3 基准现已饱和,并强调需要尽快推出新的基准。这一声明紧随 GPT-6 Astra 在基准上取得高分之后,反映出当前 AI 评测体系面临更新需求。

  • ARC-AGI 3 基准已饱和
  • 作者呼吁建立新基准
Read source
Sep 406:01 AM
AI HOT — 全部 AI 动态AI curated

Elvis Saravia 吐槽 GPT-6 Astra 发布日未开放使用,对比 Fable 5.1 当天可用

AI研究者Elvis Saravia对GPT-6 Astra发布当天未获得使用权限表示失望,并对比Fable 5.1发布日即可使用的情况,调侃希望AGI不会以这种方式发布。这一对比反映了业界对OpenAI发布策略的不满,以及对模型可用性的期待。

  • GPT-6 Astra发布日未开放使用
  • Fable 5.1当天可用形成对比
Read source
Sep 405:52 AM
AI HOT — 全部 AI 动态AI curated

职业建筑师评 GPT-6 Astra:强在旧链路而非重建工作逻辑

职业建筑师 ZHO 评价 GPT-6 Astra 的惊艳点在于通过建模/渲染软件实现高质量 3D 建模和渲染,但认为这并不惊艳,早在 2023 年就提出 AI 能生成真实照片后就不再需要效果图。他认为如果 GPT-6 足够强,应重建全新工作逻辑,而非更好地完成旧链路。

  • GPT-6 Astra 在 3D 建模渲染表现出色
  • 建筑师认为未重建工作逻辑
Read source
Sep 405:46 AM
AI HOT — 精选AI curated

GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

Greg Brockman转发ARC Prize评测称,OpenAI的GPT-6 Astra在ARC-AGI-3基准上取得SOTA,标准harness得分63%,经新Provider Adapter harness达99%,在96%的关卡上超越人类表现。排行榜显示更高推理层级通常成本更低,因Astra用更少动作通关,减少模型调用和token数。

  • GPT-6 Astra在ARC-AGI-3取得SOTA
  • 新harness下得分达99%
Read source
Sep 405:46 AM
AI HOT — 全部 AI 动态AI curated

Greg Brockman:GPT-6 Astra 在 ARC-AGI-3 取得 SOTA,基准饱和

OpenAI 联合创始人 Greg Brockman 转发 ARC Prize 评测,称 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,标准 harness 得分 63%,经新 Provider Adapter harness 达 99%,在 96% 关卡超越人类。他称该基准已饱和,并指出更高推理层级成本更低。

  • GPT-6 Astra 在 ARC-AGI-3 取得 SOTA
  • 标准 harness 63%,Provider Adapter 99%
Read source
Sep 405:33 AM
AI HOT — 全部 AI 动态AI curated

GPT-5.6 Luna 登顶 OpenRouter 榜首,OpenAI 员工称其低调表现出色

OpenAI 员工 Sherwin Wu 发帖称,GPT-5.6 Luna 已悄然登顶 OpenRouter 榜单,成为长时间以来首个登顶的闭源模型。该模型本周用量达 11.6T tokens,环比上涨 183%,价格与性能组合出色,引发社区关注。

  • GPT-5.6 Luna 登顶 OpenRouter 排行榜
  • 本周用量 11.6T tokens,环比上涨 183%
Read source
Sep 405:31 AM
AI HOT — 全部 AI 动态AI curated

Grok Bot for Enterprise 发布,企业客户限时免费

xAI 发布 Grok Bot for Enterprise,未来两周对 Grok 和 Cursor 企业客户免费。官方称部署 Bot 体验如同让公司入职数千名能干的同事,是内部采用最广、能力最强的 AI 产品。已有数千组织采用,创建数百万 Bot。

  • Grok Bot for Enterprise 正式发布
  • Grok 和 Cursor 企业客户免费两周
Read source
Sep 405:30 AM
AI HOT — 全部 AI 动态AI curated

Perplexity 将把 Astra 引入 Comet 及云端浏览器沙箱

Perplexity CEO 表示 Astra 在 computer use 方面表现出色,将把它带到 Comet 以及支撑所有 computer 使用的云端浏览器沙箱,Evals 即将推出。

  • Astra 将引入 Comet
  • 用于云端浏览器沙箱
Read source
Sep 405:17 AM
AI HOT — 全部 AI 动态AI curated

Grok Bot 企业版发布,免费试用两周

Grok Bot for Enterprise 发布,Grok 和 Cursor Enterprise 客户可免费试用两周,并邀请整个组织成员参与,包括无席位者。近几周已有数千个组织采用,创建数百万个 Bot。

  • Grok Bot 企业版发布
  • 免费试用两周
Read source
Sep 405:16 AM
AI HOT — 全部 AI 动态AI curated

OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问

OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口和 128,000 最大输出 token。在 OSWorld V2-Offline 基准上得分 72.6%,平均任务时间从 75 分钟降至 40 分钟。因触及关键网络安全阈值,访问受限。

  • GPT-6 Astra 提供 1.05M 上下文窗口
  • OSWorld V2-Offline 得分 72.6%
Read source
Sep 405:16 AM
AI HOT — 精选AI curated

GPT-6 Astra 细节:1.05M 上下文,因安全门槛限制访问

OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 105 万 token 上下文窗口和 12.8 万最大输出 token,OSWorld V2-Offline 得分 72.6%,平均任务时间从 75 分钟降至 40 分钟。因触及关键网络安全阈值,访问受限。

  • 1.05M token 上下文窗口
  • OSWorld V2-Offline 得分 72.6%
Read source
Sep 405:15 AM
AI HOT — 全部 AI 动态AI curated

swyx 实测 OpenAI Astra:20B token 验证 AI 工程能力,成本低至每小时不到 $6

swyx 转发 latent.space 对 OpenAI Astra 的实测:团队用超 20B token 将 Astra 投入各类 AI 工程任务,验证其能力,成本低于每小时 $6,展示其在实际工程中的性价比。

  • 实测使用超 20B token
  • 成本低于每小时 $6
Read source
Sep 405:14 AM
AI HOT — 全部 AI 动态AI curated

Google Labs 推出实时协作 vibe coding 实验 Play with Putty,向美国用户开放候补名单

Google 宣布推出 Google Labs 新实验 Play with Putty,目前通过候补名单面向美国用户开放。该产品定位为协作式 vibe coding 工具,支持用户实时共同构建工具和网站。

  • Google Labs 新实验 Play with Putty
  • 协作式 vibe coding 工具
Read source
Sep 405:13 AM
AI HOT — 全部 AI 动态AI curated

GPT-6 Astra 即将接入 Devin,成本比 Fable 5 低 64%

Cognition 宣布 GPT-6 Astra 即将登陆 AI 编程工具 Devin。在 FrontierCode 1.1 基准上,Astra 表现与 Fable 5 相差 0.4 分以内,但成本降低 64%,并在内部测试中创下 SOTA,生成更全面的测试和报告。

  • GPT-6 Astra 将集成到 Devin
  • 性能接近 Fable 5,成本降低 64%
Read source
Sep 405:13 AM
AI HOT — 全部 AI 动态AI curated

Perplexity 宣布将接入 OpenAI GPT-6 Astra,称其在 WANDR 评测中居首

Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益。Perplexity 将很快向 Computer 的 Pro 和 Max 用户开放 Astra。

  • Perplexity 将集成 GPT-6 Astra
  • Astra 在 WANDR 评测中居首
Read source
Sep 405:13 AM
AI HOT — 精选AI curated

Perplexity 将接入 GPT-6 Astra,称其评测居首

Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。

  • Perplexity 将接入 GPT-6 Astra
  • 称其在研究任务上领先
Read source
Sep 405:10 AM
AI HOT — 全部 AI 动态AI curated

Perplexity 评测 GPT-6 Astra:WANDR 得分 0.682 居首,单任务成本 $11.98

Perplexity 发布对 GPT-6 Astra 的评测结果,在 WANDR 基准上得分 0.682 位居榜首,单任务成本为 11.98 美元。该评测展示了 GPT-6 Astra 在复杂任务上的性能与成本平衡,为 AI 模型评估提供了新数据。

  • GPT-6 Astra 在 WANDR 基准得分 0.682,排名第一
  • 单任务成本为 11.98 美元
Read source
Sep 405:06 AM
AI HOT — 全部 AI 动态AI curated

GPT-6 Astra 登顶 Mercor APEX-Agents 榜单,法律金融咨询任务全面提升

GPT-6 Astra 在 Mercor 的 APEX-Agents 排行榜首次上榜即排名第一,Mean score 62.4%(第1),Pass@1 46.7%(第2),在法律、金融等咨询任务上表现全面提升,展示了其在专业领域的强大能力。

  • GPT-6 Astra 在 APEX-Agents 榜单首次上榜即登顶
  • Mean score 62.4% 排名第一,Pass@1 46.7% 排名第二
Read source
Sep 405:04 AM
News Hacker | 极客洞察AI curated

AI随机人生项目被批抽样失真、引用乱编

Any Human Ever 是一个网页项目,号称从所有曾活过的人中随机抽取一位,用人口统计、历史地理和LLM补全其人生细节。但评论指出其使用对数坐标易误导概率,且引用系统出现Claude补缺,不少细节并非严格史料,被质疑将统计、历史叙事与AI幻觉混为一谈。

  • 项目声称随机抽取历史人物并用AI补全人生细节
  • 对数坐标可能误导概率理解
Read source
Sep 405:04 AM
AI HOT — 全部 AI 动态AI curated

OpenAI 提出 Defense Factory 持续防御概念与"防御者窗口"

TestingCatalog 转述 OpenAI 宣布 Defense Factory,一个依赖前沿模型的持续防御概念,指自动化的防御运营,用于持续发现、验证和修复漏洞,并引入"防御者窗口"理念。

  • OpenAI 提出 Defense Factory 概念
  • 自动化持续防御运营
Read source
Sep 405:00 AM
AI HOT — 全部 AI 动态AI curated

SPACE 论文提出技能引导自适应动作分块,长程 Agent 减少 78.9% LLM 调用

论文《Act More, Decide Less》提出 SPACE 方法,从成功轨迹归纳两级程序化技能,用子技能边界监督,经混合优化蒸馏出 primitive-chunk 策略,使长程 Agent 减少 78.9% 的 LLM 调用。

  • SPACE 方法减少 78.9% LLM 调用
  • 技能引导自适应动作分块
Read source
Sep 404:59 AM
News Hacker | 极客洞察AI curated

OpenAI GPT-6 Astra 跑 ARC-AGI-3:评分、成本与 AGI 争议

OpenAI 发布 GPT-6 Astra 在 ARC-AGI-3 上的表现,引发关于评分、推理成本和 AGI 定义的讨论。评论质疑 benchmark 是否能代表智能,并探讨模型在未见任务上的泛化能力。

  • GPT-6 Astra 在 ARC-AGI-3 上的表现引发讨论
  • 争议焦点包括评分、成本和 AGI 定义
Read source
Sep 404:55 AM
AI HOT — 全部 AI 动态AI curated

Rohan Paul 解读 OpenAI GPT-6 Astra 117 页系统卡中的安全发现

Rohan Paul 梳理 OpenAI GPT-6 Astra 117 页系统卡要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,但可监控性相应下降。这一安全特性变化引发对模型自主性与可控性平衡的讨论。

  • Astra 控制链式思维的能力从 16.1% 跃升至 60.9%
  • 可监控性相应下降
Read source
Sep 404:55 AM
AI HOT — 精选AI curated

Rohan Paul 解读 OpenAI GPT-6 Astra 117 页系统卡中的安全发现

Rohan Paul 梳理 OpenAI GPT-6 Astra 117 页系统卡要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,但可监控性相应下降,引发对安全与可控性的讨论。

  • Astra 链式思维控制能力大幅提升
  • 可监控性下降
Read source
Sep 404:51 AM
AI HOT — 全部 AI 动态AI curated

NVIDIA 收购 Hugging Face 的消息传出,作者预期双方 AI 基础设施将深度整合

有消息称 NVIDIA 收购了 Hugging Face,作者预期未来两家公司将推出紧密集成一体的 AI 基础设施,并期待 from_pretrained() 等接口能带来最流畅的体验。该消息若属实,将深刻影响 AI 开源生态和基础设施格局。

  • 传出 NVIDIA 收购 Hugging Face 消息
  • 预期双方 AI 基础设施深度整合
Read source
Sep 404:49 AM
AI HOT — 全部 AI 动态AI curated

Charlie Holtz 发布 Cloud Desktop,让云机器用起来像本地环境

Charlie Holtz 发布 Cloud Desktop,一种与云机器交互的新方式,让云机器用起来像 localhost。用户可以观看智能体工作,并在需要时随时接管控制,提升云开发体验。

  • Cloud Desktop 让云机器交互像本地环境
  • 用户可观看智能体工作并随时接管
Read source
Sep 404:47 AM
AI HOT — 全部 AI 动态AI curated

Google DeepMind 等提出 Declarative Attention,让模型自行控制注意力以减少 KV cache 读取

KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》,提出 Declarative Attention 方法,让模型在推理过程中自行控制注意力范围,以减少 KV cache 读取,提升效率。

  • 提出 Declarative Attention 方法
  • 模型可自行控制注意力范围
Read source
Sep 404:45 AM
AI HOT — 全部 AI 动态AI curated

Charlie Holtz 附议 Ethan Mollick:多人协作式 AI 仍是当前 AI 应用一大难题

Charlie Holtz 转发并附议 Ethan Mollick 的观点,指出多人协作式 AI,即组织中多人共同使用 AI 完成目标,是当前 AI 应用中最重要的非技术问题之一。Mollick 认为现有方案仍很原始,多基于把 AI 当作群聊成员的思路,存在局限。

  • 多人协作式 AI 是重要非技术难题
  • 现有方案原始,有局限
Read source
Sep 404:43 AM
AI HOT — 全部 AI 动态AI curated

ARC Prize:GPT-6 Astra 以标准 harness 在 ARC-AGI-3 拿下 63% 得分

ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 上的表现:标准 harness 得分 63%,经新 provider adapter harness 可达 99%,并在 96% 关卡上动作效率超过受测人类中位数。模型能将陌生环境转化为符号世界模型,展现强大推理能力。

  • 标准 harness 得分 63%,新 harness 可达 99%
  • 96% 关卡动作效率超过人类中位数
Read source
Sep 404:41 AM
AI HOT — 全部 AI 动态AI curated

GPT-6-Astra 发布点评:基准碾压 Fable 5.1,OpenAI 反超 Anthropic

作者点评 OpenAI 新发布的基础模型 GPT-6-Astra,认为基准显示其在浏览器操作、计算机操作、Excel、编码、药物发现、数学研究等领域达到专家水平,Sam Altman 和 Greg Brockman 称其可能接近 AGI。

  • GPT-6-Astra 在多个领域达专家水平
  • OpenAI 反超 Anthropic
Read source
Sep 404:40 AM
AI HOT — 全部 AI 动态AI curated

Google DeepMind 等提出 Declarative Attention,让模型自控注意力范围

KAIST AI 与 Google DeepMind 等机构发布论文《Language Models Can Control Their Own Attention》,提出 Declarative Attention 方法,使语言模型在链式推理中能够自行控制注意力范围。该研究或为提升模型推理效率和可解释性提供新思路。

  • 提出 Declarative Attention 方法
  • 模型可自行控制注意力范围
Read source
Sep 404:39 AM
AI HOT — 全部 AI 动态AI curated

GPT-6 Astra 案例合集展示建筑设计全流程演示

ZHO 发起 GPT-6 Astra 案例合集帖,转引他人视频演示建筑设计全流程:从平面图设计、Blender 建模到 UE5 渲染与建筑漫游视频,并包含细节细化。作者认为前期概念方案可由 GPT-6 完成,展示其在创意设计领域的应用潜力。

  • 展示 GPT-6 在建筑设计全流程中的应用
  • 涵盖平面图、建模、渲染等环节
Read source
Sep 404:33 AM
AI HOT — 全部 AI 动态AI curated

ZHO 评 GPT-6 Astra 官方文章:案例缺乏想象力,催促尽快开放测试

AI 领域知名博主 ZHO 在看完 GPT-6 Astra 官方文章后表示无感,认为文中展示的案例缺乏想象力,多基于现有场景的惯性思维。他催促 OpenAI 尽快开放测试,认为如果模型能力真的强大,应有更具突破性的展示方式。

  • 对 GPT-6 Astra 官方展示案例提出批评
  • 认为案例缺乏想象力
Read source
Sep 404:32 AM
AI HOT — 全部 AI 动态AI curated

Sam Altman 发布 GPT-6 Astra 博客链接

TestingCatalog 转发 Sam Altman 推文,Altman 表示博客部署遇到小问题但内容很棒,并给出 GPT-6 Astra 官方介绍链接。该消息侧面印证了 GPT-6 Astra 的发布进程,并透露了发布过程中的一些细节。

  • Sam Altman 分享 GPT-6 Astra 博客
  • 提及部署遇到小问题
Read source
Sep 404:28 AM
AI HOT — 全部 AI 动态AI curated

Hojo-ASR-Multi-V1 上线 Open ASR Leaderboard,开源多语言语音识别平均 WER 3.54%

HojoAI 的 Hojo-ASR-Multi-V1 正式上线 Open ASR Leaderboard,全球排名第 7,开源多语言 ASR 中排名第 1,五语言平均 WER 3.54%。该模型展示了开源语音识别技术的显著进步。

  • Hojo-ASR-Multi-V1 全球排名第 7,开源多语言 ASR 第 1
  • 五语言平均 WER 3.54%
Read source
Sep 404:28 AM
AI HOT — 全部 AI 动态AI curated

GPT-6 Astra 75 分钟构建浏览器版 macOS 模拟器 demo

GPT-6 Astra 在 75 分钟内根据同一提示词构建出浏览器版 macOS 模拟器,支持 cloud sync 和可用应用。引用者称这是他见过最好的输出,展示了 GPT-6 Astra 在复杂代码生成和产品构建方面的强大能力。

  • 75 分钟内构建浏览器版 macOS 模拟器
  • 支持 cloud sync 和可用应用
Read source
Sep 404:23 AM
AI HOT — 全部 AI 动态AI curated

ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于 François Chollet 预期一倍

Sherwin Wu 表示 ARC-AGI-3 基准已被 GPT-6 Astra 饱和。François Chollet 透露,ARC 3 发布时预计前沿模型约一年才能饱和,实际仅用 6 个月,约为预期的 2 倍速度。新一代模型能力将挑战人们基于旧模型形成的 AI 观点。

  • ARC-AGI-3 发布半年即被 Astra 饱和
  • 进展速度是 Chollet 预期的两倍
Read source
Sep 404:23 AM
AI HOT — 精选AI curated

ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于预期一倍

据 Sherwin Wu 引用 François Chollet 的观点,ARC-AGI-3 基准发布时预计前沿模型约需一年才能饱和,但 GPT-6 Astra 仅用 6 个月便达到饱和,速度约为预期的两倍。这一进展表明新一代模型能力提升迅速,或将挑战人们基于旧模型形成的 AI 认知。

  • ARC-AGI-3 被 Astra 在半年内饱和
  • 进展速度是 François Chollet 预期的两倍
Read source
Sep 404:22 AM
AI HOT — 精选AI curated

OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA

OpenAI 正式发布 GPT-6 Astra,官方宣布其在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 等多项基准测试中达到 SOTA 水平,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。这是 OpenAI 在 AI 模型能力上的又一次重大更新。

  • GPT-6 Astra 正式发布
  • 在多项基准测试中达到 SOTA
Read source
Sep 404:22 AM
AI HOT — 全部 AI 动态AI curated

OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA

OpenAI 正式发布新一代模型 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 等多项基准测试中达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。该模型被视为 AI 能力的重要跃升,引发社区广泛关注。

  • GPT-6 Astra 在多个高难度基准上达到 SOTA
  • 覆盖数学、推理、终端操作等能力
Read source
Flowtify — AI Reading, Knowledge & Creation Workspace