noreply@aihot.virxact.com (X:Yuchen Jin (@Yuchenj_UW))
noreply@aihot.virxact.com (X:Yuchen Jin (@Yuchenj_UW))
Yuchen Jin 调侃 GPT-6 Astra AGI 传闻与今晨网络故障

Yuchen Jin 发推调侃听说的 GPT-6 Astra 被称为 AGI 到来和"代际飞跃"的说法,并反讽称这就是今天早上半个互联网宕机的原因,戏称 AGI 已经接管了一切。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw9p8j0pierow5dbjr4yo9

noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
GPT-6 Astra 在 ARC-AGI 3 上得 98.6%,远超上一代 7.8% 引发讨论

GPT-6 Astra 在 ARC-AGI 3 上取得 98.6%,而上一代 GPT-5.6 Sol 为 7.8%,作者连用多个问号表示难以置信。附图还显示其在 FrontierMath Tier 4 (v2) 得 97.6%、ExploitBench 得 100%、SRE-Bench (four attempts) 得 99.2%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwfzob0pmzrow5o0t252bz

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
GPT-6 Astra 基准测试对比 GPT-5.6 Sol 与 Claude Fable 5.1,ARC-AGI-3 从 7.8% 升至 98.6%

作者转发一张完整基准对比表,称 OpenAI 新发布的 GPT-6 Astra 在多项评测上明显领先。ARC-AGI-3 从 GPT-5.6 Sol 的 7.8% 升至 98.6%,FrontierMath Tier 4 (v2) 为 97.6%,SRE-Bench 为 99.2%,ExploitBench 为 100.0%;作者称其压过了新发布的 Claude Fable 5.1。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwgygo0pnprow5t9xcoyy4

noreply@aihot.virxact.com (X:Noam Brown (@polynoamial))
noreply@aihot.virxact.com (X:Noam Brown (@polynoamial))
GPT-6 Astra 完成素数间隔不超过 186 的 Lean 形式化证明

OpenAI 发布仓库 PrimeGaps186(https://github.com/openai/PrimeGaps186),其中 GPT-6-Astra 的 Lean 形式化证明了存在无穷多对间隔不超过 186 的相邻素数。Noam Brown 表示在 GPT-6 Astra 的所有用途中最期待科学发现,称 OpenAI 尚未在数学和科学上把该模型推向极限。仓库说明指出 Lean 结果仍依赖三个明确输入公理,被引用的数学估计和数值计算尚未转化为这些输入的 Lean 证明。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw5jja0pdrrow5m965czk1

noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
Martian 发布 AI Frontier 交互面板,对比 44 个 LLM 的质量、成本与一致性

Martian 发布 AI Frontier,一个交互式面板,衡量 44 个 LLM 在真实工作负载中的质量、成本以及跨重复运行解决同一问题的稳定性。面板分五个视图:单模型档案、一对一对比、标价 vs 实测成本、重复尝试一致性(得分约 0.74 到 0.96)和方法论。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw2lh10pc3row5ur2jjbte

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
GPT-6 Astra 完整基准测试曝光,ARC-AGI-3 达 98.6%

一张基准对比表列出 GPT-6 Astra 的多项成绩:ARC-AGI-3 为 98.6%(对照 GPT-5.6 Sol 为 7.8%),FrontierMath Tier 4 (v2) 97.6%,GPQA Diamond 96%,ExploitBench 100%,DeepSWE v1.1 74.1%。引用内容称 OpenAI 计划在未来几天内将该模型带给付费 ChatGPT 订阅用户及其 API。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlveddr0ol0row5kpfkfdzv

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
Martian AI Frontier 推出模型可靠性榜单,跨模型路由错误减少 46%-54%

Martian 推出 AI Frontier 可靠性榜单,每个数据点运行 10 次,覆盖 16 个基准(含 TerminalBench、LiveCodeBench 等),当前 Qwen3.7 Max 可靠性 96.1%,Claude Opus 4.6 为 94.4%,GPT-5.5 为 93.5%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlveddr0ol1row593o1krel

加载更多资讯