noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))
noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))
OpenAI 发布 GPT-6 Astra,先向受限网络安全客户开放

OpenAI 发布 GPT-6 Astra,首先向经过审核的 Daybreak 网络安全客户开放,Plus、Pro、Business、Enterprise、API 和 AWS 将在未来数日内跟进。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwgyh00pnqrow5t4ajo0y7

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))
noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))
Ethan Mollick:多人协作 AI 是当前组织使用 AI 的最大非技术难题之一

Ethan Mollick 认为,让组织中许多人共同使用 AI 完成目标的多人在协作 AI,仍是当前 AI 应用中最大的非技术难题之一。他指出现有方案相当原始,多围绕群聊中的 AI 作为一个成员展开,这种方式存在局限。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw2lgu0pc2row5jw1ccexd

noreply@aihot.virxact.com (MarkTechPost(RSS))
noreply@aihot.virxact.com (MarkTechPost(RSS))
Meta AI 发布 Muse Spark 1.3,工具调用减少约 20%、token 消耗减少约 25%

Meta Superintelligence Labs 发布 Muse Spark 1.3,面向长程智能体与编码任务,已在 Muse Code 和 Meta Model API 上线,权重闭源不可自托管,上下文窗口为 1M token。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw63gb0pfgrow5872w41f9

noreply@aihot.virxact.com (X:Yuchen Jin (@Yuchenj_UW))
noreply@aihot.virxact.com (X:Yuchen Jin (@Yuchenj_UW))
Yuchen Jin 调侃 GPT-6 Astra AGI 传闻与今晨网络故障

Yuchen Jin 发推调侃听说的 GPT-6 Astra 被称为 AGI 到来和"代际飞跃"的说法,并反讽称这就是今天早上半个互联网宕机的原因,戏称 AGI 已经接管了一切。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw9p8j0pierow5dbjr4yo9

noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
noreply@aihot.virxact.com (X:ZHO (@ZHO_ZHO_ZHO))
GPT-6 Astra 在 ARC-AGI 3 上得 98.6%,远超上一代 7.8% 引发讨论

GPT-6 Astra 在 ARC-AGI 3 上取得 98.6%,而上一代 GPT-5.6 Sol 为 7.8%,作者连用多个问号表示难以置信。附图还显示其在 FrontierMath Tier 4 (v2) 得 97.6%、ExploitBench 得 100%、SRE-Bench (four attempts) 得 99.2%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwfzob0pmzrow5o0t252bz

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
GPT-6 Astra 基准测试对比 GPT-5.6 Sol 与 Claude Fable 5.1,ARC-AGI-3 从 7.8% 升至 98.6%

作者转发一张完整基准对比表,称 OpenAI 新发布的 GPT-6 Astra 在多项评测上明显领先。ARC-AGI-3 从 GPT-5.6 Sol 的 7.8% 升至 98.6%,FrontierMath Tier 4 (v2) 为 97.6%,SRE-Bench 为 99.2%,ExploitBench 为 100.0%;作者称其压过了新发布的 Claude Fable 5.1。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlwgygo0pnprow5t9xcoyy4

noreply@aihot.virxact.com (X:Noam Brown (@polynoamial))
noreply@aihot.virxact.com (X:Noam Brown (@polynoamial))
GPT-6 Astra 完成素数间隔不超过 186 的 Lean 形式化证明

OpenAI 发布仓库 PrimeGaps186(https://github.com/openai/PrimeGaps186),其中 GPT-6-Astra 的 Lean 形式化证明了存在无穷多对间隔不超过 186 的相邻素数。Noam Brown 表示在 GPT-6 Astra 的所有用途中最期待科学发现,称 OpenAI 尚未在数学和科学上把该模型推向极限。仓库说明指出 Lean 结果仍依赖三个明确输入公理,被引用的数学估计和数值计算尚未转化为这些输入的 Lean 证明。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw5jja0pdrrow5m965czk1

noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
Martian 发布 AI Frontier 交互面板,对比 44 个 LLM 的质量、成本与一致性

Martian 发布 AI Frontier,一个交互式面板,衡量 44 个 LLM 在真实工作负载中的质量、成本以及跨重复运行解决同一问题的稳定性。面板分五个视图:单模型档案、一对一对比、标价 vs 实测成本、重复尝试一致性(得分约 0.74 到 0.96)和方法论。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlw2lh10pc3row5ur2jjbte

加载更多资讯