GPT-6 Astra 在 ARC-AGI-3 上以标准 harness 得分 63%,经新的 provider adapter harness 可达 99%,并在 96% 的关卡上动作效率超过受测人类中位数。ARC Prize 观察到它能将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则并自建领域速记语言来跟踪状态和规划动作。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm0cxf50tbarow5oanflyrd
AI HOT
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzop5k0sl1row540az8372
ZHO 发起 GPT-6 Astra 案例合集帖,转引他人视频演示建筑设计全流程:先设计平面图,在 Blender 中完成建模,再到 UE5 中完成渲染与建筑漫游视频,还包括细节细化和最终大图。引用作者认为前期概念方案可以用 GPT-6 完成。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlznu590skdrow5fu4juc74
ZHO 表示看完 GPT-6 Astra 官方文章已经无感,只想直接测试,并催促 OpenAI 尽快发布。他认为文章里的很多案例太缺乏想象力,太多基于现有场景的惯性,如果模型真的强无敌,能力展现不止如此。原文附官方文章链接 https://openai.com/index/gpt-6-astra/。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlznu590skerow5jyl56hdv
TestingCatalog 转发 Sam Altman 推文,其称博客部署遇到小问题但内容很棒,并给出链接 https://openai.com/index/gpt-6-astra/。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm0cxf50tbbrow5t5wy5swn
HojoAI 的 Hojo-ASR-Multi-V1 正式上线 Open ASR Leaderboard,全球排名第 7、开源多语言 ASR 第 1,五语言平均 WER 3.54%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzop5w0sl2row5zkbpxl4h
GPT-6 Astra 在 75 分钟内根据同一 simulate macOS 27 提示词构建出浏览器版 macOS 模拟器。引用者 @mweinbach 称这是他见过最好的输出,登录后还支持 cloud sync 和可用的应用,demo 地址为 https://macos-27-simulator.mweinbach.chatgpt.site/。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzumit0sohrow5kmq1s2sf
Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzumiu0soirow5cfujh2xf
OpenAI 发布 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 上达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzumiu0sojrow5820i30sg
🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzl4e70sirrow5w4zkypzs