noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
ARC Prize:GPT-6 Astra 以标准 harness 在 ARC-AGI-3 拿下 63% 得分

GPT-6 Astra 在 ARC-AGI-3 上以标准 harness 得分 63%,经新的 provider adapter harness 可达 99%,并在 96% 的关卡上动作效率超过受测人类中位数。ARC Prize 观察到它能将陌生环境转化为紧凑的符号世界模型,把游戏机制表示为逻辑规则并自建领域速记语言来跟踪状态和规划动作。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm0cxf50tbarow5oanflyrd

noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
GPT-6 Astra 案例合集帖展示建筑设计全流程演示

ZHO 发起 GPT-6 Astra 案例合集帖,转引他人视频演示建筑设计全流程:先设计平面图,在 Blender 中完成建模,再到 UE5 中完成渲染与建筑漫游视频,还包括细节细化和最终大图。引用作者认为前期概念方案可以用 GPT-6 完成。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlznu590skdrow5fu4juc74

noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
ZHO 评 GPT-6 Astra 官方文章:案例缺乏想象力,催促 OpenAI 尽快开放测试

ZHO 表示看完 GPT-6 Astra 官方文章已经无感,只想直接测试,并催促 OpenAI 尽快发布。他认为文章里的很多案例太缺乏想象力,太多基于现有场景的惯性,如果模型真的强无敌,能力展现不止如此。原文附官方文章链接 https://openai.com/index/gpt-6-astra/。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlznu590skerow5jyl56hdv

noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
Sam Altman 发布 GPT-6 Astra 博客链接

TestingCatalog 转发 Sam Altman 推文,其称博客部署遇到小问题但内容很棒,并给出链接 https://openai.com/index/gpt-6-astra/。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm0cxf50tbbrow5t5wy5swn

noreply@aihot.virxact.com (X:Sherwin Wu(@sherwinwu))
noreply@aihot.virxact.com (X:Sherwin Wu(@sherwinwu))
Sherwin Wu 转引 GPT-6 Astra 75 分钟构建浏览器版 macOS 模拟器 demo

GPT-6 Astra 在 75 分钟内根据同一 simulate macOS 27 提示词构建出浏览器版 macOS 模拟器。引用者 @mweinbach 称这是他见过最好的输出,登录后还支持 cloud sync 和可用的应用,demo 地址为 https://macos-27-simulator.mweinbach.chatgpt.site/。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzumit0sohrow5kmq1s2sf

noreply@aihot.virxact.com (X:Sherwin Wu(@sherwinwu))
noreply@aihot.virxact.com (X:Sherwin Wu(@sherwinwu))
ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于 François Chollet 预期一倍

Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzumiu0soirow5cfujh2xf

noreply@aihot.virxact.com (X:Sherwin Wu(@sherwinwu))
noreply@aihot.virxact.com (X:Sherwin Wu(@sherwinwu))
OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA

OpenAI 发布 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 上达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlzumiu0sojrow5820i30sg

加载更多资讯