OpenAI 发布 GPT-6 Astra,首先向经过审核的 Daybreak 网络安全客户开放,Plus、Pro、Business、Enterprise、API 和 AWS 将在未来数日内跟进。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwgyh00pnqrow5t4ajo0y7
AI HOT
🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwgygo0pnorow5q12m2p9j
Ethan Mollick 认为,让组织中许多人共同使用 AI 完成目标的多人在协作 AI,仍是当前 AI 应用中最大的非技术难题之一。他指出现有方案相当原始,多围绕群聊中的 AI 作为一个成员展开,这种方式存在局限。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw2lgu0pc2row5jw1ccexd
Meta Superintelligence Labs 发布 Muse Spark 1.3,面向长程智能体与编码任务,已在 Muse Code 和 Meta Model API 上线,权重闭源不可自托管,上下文窗口为 1M token。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw63gb0pfgrow5872w41f9
Yuchen Jin 发推调侃听说的 GPT-6 Astra 被称为 AGI 到来和"代际飞跃"的说法,并反讽称这就是今天早上半个互联网宕机的原因,戏称 AGI 已经接管了一切。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw9p8j0pierow5dbjr4yo9
GPT-6 Astra 在 ARC-AGI 3 上取得 98.6%,而上一代 GPT-5.6 Sol 为 7.8%,作者连用多个问号表示难以置信。附图还显示其在 FrontierMath Tier 4 (v2) 得 97.6%、ExploitBench 得 100%、SRE-Bench (four attempts) 得 99.2%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwfzob0pmzrow5o0t252bz
作者转发一张完整基准对比表,称 OpenAI 新发布的 GPT-6 Astra 在多项评测上明显领先。ARC-AGI-3 从 GPT-5.6 Sol 的 7.8% 升至 98.6%,FrontierMath Tier 4 (v2) 为 97.6%,SRE-Bench 为 99.2%,ExploitBench 为 100.0%;作者称其压过了新发布的 Claude Fable 5.1。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwgygo0pnprow5t9xcoyy4
OpenAI 发布仓库 PrimeGaps186(https://github.com/openai/PrimeGaps186),其中 GPT-6-Astra 的 Lean 形式化证明了存在无穷多对间隔不超过 186 的相邻素数。Noam Brown 表示在 GPT-6 Astra 的所有用途中最期待科学发现,称 OpenAI 尚未在数学和科学上把该模型推向极限。仓库说明指出 Lean 结果仍依赖三个明确输入公理,被引用的数学估计和数值计算尚未转化为这些输入的 Lean 证明。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw5jja0pdrrow5m965czk1
Martian 发布 AI Frontier,一个交互式面板,衡量 44 个 LLM 在真实工作负载中的质量、成本以及跨重复运行解决同一问题的稳定性。面板分五个视图:单模型档案、一对一对比、标价 vs 实测成本、重复尝试一致性(得分约 0.74 到 0.96)和方法论。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw2lh10pc3row5ur2jjbte
TechCrunch 报道,初创公司 Abliteration.ai 将去除安全护栏的开源权重模型(包括 Z.ai 的 GLM-5.3)托管为商业服务,用户可通过网页或 API 免费查询。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw62pu0pf8row5l8yc2lf3