noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d5robnsn25onbz

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
Cerebras 推理平台提供 Qwen 3.8 27B,速度约 1500 tokens/s

Cerebras 公共端点模型目录新增 Qwen 3.8 27B(qwen-3.8-27b,27 billion 参数,上下文 64k/128k,速度约 1500 tokens/s),另有 gpt-oss-120b(120 billion 参数,65k/131k 上下文,约 3000 tokens/s)。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d7robnoq6lpdny

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
OpenAI 发布 GPT-6 Astra:多项基准刷新纪录并强化网络安全能力

OpenAI 发布 GPT-6 Astra,称其在 FrontierMath Tier 4 达 98%、ARC-AGI-3 达 99.9%、ExploitBench 达 100%,并称其网络安全能力达到 Preparedness Framework 的 Critical 门槛。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d6robnym0jg0b7

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
OpenAI 开始推出 GPT-6 Astra

OpenAI 开始推出 GPT-6 Astra。参与其申请制网络安全项目的企业将率先获得 Astra 访问权限。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01d8robnnj6vo2ap

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
开发者用 Claude Fable 5 在 Claude Code 中将 1993 年 Amiga 游戏 Babylonian Twins 移植到 Godot

作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5s01dbrobnjyyupz0q

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
申真谞让两子击败围棋 AI KataGo

世界排名第一的围棋棋手申真谞(Shin Jin-seo)周二在对顶级围棋 AI 引擎 KataGo 的让两子对局中完成逆转并取胜。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm7yl5t01derobnok1zp0qq

noreply@aihot.virxact.com (X:cb_doge (@cb_doge))
noreply@aihot.virxact.com (X:cb_doge (@cb_doge))
Grok 4.6 在多项基准上超过 OpenAI GPT-6 Astra (Max)

据 Artificial Analysis 数据,Grok 4.6 (High) 在多项基准上超过 OpenAI GPT-6 Astra (Max):Agentic Index 59 对 51,τ3-Banking 51% 对 41%,Non-hallucination 66% 对 49%,GDPval-AA v2 1,730 对 1,629。作者称 Grok 4.7 很快将到来。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm6sdqr01rxrocws3n6xer0

noreply@aihot.virxact.com (X:AI Safety Memes (@AISafetyMemes))
noreply@aihot.virxact.com (X:AI Safety Memes (@AISafetyMemes))
Ryan Greenblatt称GPT-6 Astra不透明推理能力大幅跃升,链式思维监督或失效

Ryan Greenblatt称GPT-6 Astra在不透明推理上出现巨大跃升,能在不外显推理的情况下心算解出高难度竞赛数学题,而此前AI只能解基础应用题。他提醒基准结果可能受污染,并提到UK AISI发现Astra的monitorability明显更差;他猜测跃升源自增加串行深度的架构改动,若未来几代模型延续此类跃升,chain-of-thought将不再是有效的监督工具。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm6pqhd01o7rocwtayjudjo

noreply@aihot.virxact.com (X:Emad Mostaque (@EMostaque))
noreply@aihot.virxact.com (X:Emad Mostaque (@EMostaque))
Astra 在 Stargate Texas 使用 10 万块 GPU 完成 train run

Emad Mostaque 称 Astra 在 Stargate Texas 使用 100k GPUs,用约两个月时间预训练,使其成为首个 10 亿美元规模的训练 run。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtm6384k015tro62qpbd936l

加载更多资讯