2026-08-02
① OpenAI 预热下一代模型 Astra,以约 $2000 成本解决 10 个十年未解数学难题;② 模型推理能力的又一次跃升,将直接影响 coding agent 的底层表现;③ 目前无需立即行动,但应关注 Astra 的 API 时间表及其在 coding 任务上的能力复现。
A · 深度观察
- Karpathy 用 Opus 5 生成《指环王》3D 渲染,暴露 LLM 视觉感知弱点 — 以 100 万 token 预算生成 5500 行 Three.js 代码,过程暴露 LLM 无法直接感知渲染结果、需通过截图缓慢审计的局限性 · 来源
- Nan Yu 提出 token 质押机制:悬赏 issue 让云 agent 自动解决,减少 slop PR — 设计 issue 中 pledge token → agent 自动实现 → 维护者审核的流程,可能重塑开源协作模式 · 来源
- Swyx 推荐 AI 原生编程语言 Boundary:从 slop-tolerant 出发重新思考代码执行 — 分享 talk「fighting slop with slop」,提出 AI 原生语言应容忍代码不完美,颠覆传统 PL 设计 · 来源
- Matt Pocock 探讨 Agent 用于突变测试与领域语言的力量 — 建议用 agent 做 mutation testing 验证测试覆盖率,并指出 domain language 可大幅提升 agent 效率 · 来源
C · 产品动态
1. OpenAI 预热下一代模型 Astra:$2000 解 10 道十年数学难题
📌 发生了什么 — OpenAI 公开内部模型 Astra 的数学能力:解决了 10 个过去十年无进展的数学问题,每个问题平均 token 成本不到 $2000。CEO Sam Altman 已飞往华盛顿与政府沟通模型发布计划。
💬 讨论 — 数学界出现「Deep Blue 时刻」的集体情绪,数学家 Kirwin Hampshire 此前发表《数学的暗夜》表达危机感;科技圈对极低成本解决难题感到震惊,Kevin Weil 称「未来将令人敬畏」。
🔗 来源 — OpenAI CPO Kevin Weil · OpenAI Codex PM Derrick Choi
💡 Insight — 模型推理正从通用技能转向深度领域突破,coding 等垂直领域将最先承受 overhang——当此类推理接入 API,coding agent 在架构设计、bug 定位和形式化验证上的表现可能大幅跃升。应关注 Astra 在 SWE-bench 等 benchmark 上的后续表现及 API 可用时间。