noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
GPT-6 Astra 完整基准测试曝光,ARC-AGI-3 达 98.6%

一张基准对比表列出 GPT-6 Astra 的多项成绩:ARC-AGI-3 为 98.6%(对照 GPT-5.6 Sol 为 7.8%),FrontierMath Tier 4 (v2) 97.6%,GPQA Diamond 96%,ExploitBench 100%,DeepSWE v1.1 74.1%。引用内容称 OpenAI 计划在未来几天内将该模型带给付费 ChatGPT 订阅用户及其 API。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlveddr0ol0row5kpfkfdzv

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
Martian AI Frontier 推出模型可靠性榜单,跨模型路由错误减少 46%-54%

Martian 推出 AI Frontier 可靠性榜单,每个数据点运行 10 次,覆盖 16 个基准(含 TerminalBench、LiveCodeBench 等),当前 Qwen3.7 Max 可靠性 96.1%,Claude Opus 4.6 为 94.4%,GPT-5.5 为 93.5%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlveddr0ol1row593o1krel

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
noreply@aihot.virxact.com (X:Kim (@kimmonismus))
GPT-6 Astra 发布,OpenAI 公布多项基准成绩

GPT-6 Astra 发布。OpenAI 报告其在 FrontierMath Tier 4 v2 得分 97.6%、DeepSWE v1.1 得分 74.1%、BenchCAD 95.9%、GPQA Diamond 96%、ExploitBench 100%,ARC-AGI-3 报告为 98.6%(reported)。新模型计划在未来几天内面向付费 ChatGPT 订阅用户和 API 开放。Greg Brockman 称这可能是 AGI 的到来,是一次 generational leap。图片内容提示 ARC-AGI-3 的 98.6% 带有重要限定条件,当前 ARC-AGI-3 排行榜上传统前沿模型的成绩远低于该数字,但对比并不直接。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlveddr0ol2row58ipew3gm

noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
OpenAI 发布 GPT-6 Astra,初期仅向 Daybreak Access 组织开放

OpenAI 发布 GPT-6 Astra,初期仅向 Daybreak Access 计划中的组织开放,未来几天将陆续推送给所有 Plus、Pro、Business 和 Enterprise 用户。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlv00350o36row5602bsjzv

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))
noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))
Thinking Machines Lab 传洽谈以至少 400 亿美元投前估值融资至少 10 亿美元

据 The Information 报道,Mira Murati 的 Thinking Machines Lab 正洽谈以至少 400 亿美元投前估值融资至少 10 亿美元,Accel 讨论领投,Nvidia 可能参投。该估值约为其 2025 年种子轮约 100 亿美元投前估值的 4 倍,但仍低于去年底探讨的 500 亿美元以上水平。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlubswf0nmwrow5w5i8d9pu

noreply@aihot.virxact.com (X:Claude Devs (@ClaudeDevs))
noreply@aihot.virxact.com (X:Claude Devs (@ClaudeDevs))
Claude Code 探索 Function Hooks 自定义扩展机制

Anthropic 的 Claude Devs 账号宣布正在探索让用户扩展和自定义 Claude Code 的新方式 Function Hooks。该功能尚未上线,官方发布了两段演示视频,并在 GitHub issue 上征集反馈。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtlu88g70nkwrow59m23femw

加载更多资讯