OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d5robnsn25onbz
AI HOT
Cerebras 公共端点模型目录新增 Qwen 3.8 27B(qwen-3.8-27b,27 billion 参数,上下文 64k/128k,速度约 1500 tokens/s),另有 gpt-oss-120b(120 billion 参数,65k/131k 上下文,约 3000 tokens/s)。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d7robnoq6lpdny
OpenAI 发布 GPT-6 Astra,称其在 FrontierMath Tier 4 达 98%、ARC-AGI-3 达 99.9%、ExploitBench 达 100%,并称其网络安全能力达到 Preparedness Framework 的 Critical 门槛。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d6robnym0jg0b7
OpenAI 开始推出 GPT-6 Astra。参与其申请制网络安全项目的企业将率先获得 Astra 访问权限。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d8robnnj6vo2ap
作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01dbrobnjyyupz0q
世界排名第一的围棋棋手申真谞(Shin Jin-seo)周二在对顶级围棋 AI 引擎 KataGo 的让两子对局中完成逆转并取胜。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5t01derobnok1zp0qq
Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm76qwb027qrocwz9t3q2jx
据 Artificial Analysis 数据,Grok 4.6 (High) 在多项基准上超过 OpenAI GPT-6 Astra (Max):Agentic Index 59 对 51,τ3-Banking 51% 对 41%,Non-hallucination 66% 对 49%,GDPval-AA v2 1,730 对 1,629。作者称 Grok 4.7 很快将到来。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm6sdqr01rxrocws3n6xer0
Ryan Greenblatt称GPT-6 Astra在不透明推理上出现巨大跃升,能在不外显推理的情况下心算解出高难度竞赛数学题,而此前AI只能解基础应用题。他提醒基准结果可能受污染,并提到UK AISI发现Astra的monitorability明显更差;他猜测跃升源自增加串行深度的架构改动,若未来几代模型延续此类跃升,chain-of-thought将不再是有效的监督工具。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm6pqhd01o7rocwtayjudjo
Emad Mostaque 称 Astra 在 Stargate Texas 使用 100k GPUs,用约两个月时间预训练,使其成为首个 10 亿美元规模的训练 run。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm6384k015tro62qpbd936l