2026-07-30
Cursor 正式登陆 iPad,将 agent 驱动开发全流程带入移动端。OpenAI 通过两项 API 设置让 benchmark 成绩提升三倍,再次印证 harness 设计是当前模型能力释放的关键——读其技术细节值得,上手 Cursor 更新更紧迫。
A · 深度观察
- 模型能力天花板?Harness 设计如何让表现提升数倍——从 ARC-AGI-3 到 agent 软件质量 — OpenAI 仅通过保留推理过程与启用压缩,便将 ARC-AGI-3 得分提升三倍,token 消耗减少六倍;Addy Osmani 同步指出,当 agent 生成的代码超过人类审查能力时,软件质量必须前置到约束与测试 harness 中。 · 来源
- Jerry Tworek 和 Rohan Anil:Transformer 不是终点,持续学习才是下一个突破口 — 两人在 Core Automation 逆势押注架构革新:in-context learning 耗尽过快(Codex 约 20 分钟就需要 compact),transformer 无法在测试时适应,而持续学习才是缺失的核心能力。他们还解释了为何大厂在 coding agent 军备竞赛中不愿切换架构。 · 来源
- Codex PM:用“交付了什么”和“花了多少钱”替代 token 计数 — OpenAI Codex 产品负责人提出以 cost per successful task 作为企业采购评估核心,同时强调 IT admin 需掌握 access 与 spend 治理权,让 measurable business outcome 取代惊喜账单。 · 来源
- 当 agent 写出代码,人类的工作变成定义“什么算好” — LangChain 的 Viv 分享实战心得:自动化 eval 生成只是减负,真正让 agent 行为对齐目标的是人类持续校准“好”的定义——agent 被 benchmark 塑形,而 evals 就是编码人类意图的模具。 · 来源
B · GitHub Trending
- different-ai/openwork — 基于 opencode 的开源 Claude Cowork 替代方案,用一个仓库把协同编码 agent 跑起来。
C · 产品动态
1. Cursor for iPad 发布,支持移动端全流程开发
📌 发生了什么 — Cursor 正式支持 iPad,所有付费计划可用。大屏布局下侧边栏聊天可固定,支持分屏同时审查代码与对话,文件 diff 完整渲染;使用截图标记或 Apple Pencil 绘图可直接给出反馈。移动端新增 Inbox 收件箱,可查看进行中任务、待办和 PR 审查状态;审查界面覆盖完整 PR(评论、检查、审批)。同时新增 Bitbucket 与 Azure DevOps SCM 支持、多 PR 会话、团队切换等功能。
💬 讨论 — 社区反响积极,Cursor 设计负责人 Ryo Lu 在 X 上同步宣传“try Cursor on iOS today”,强调 agents 随处可用。
🔗 来源 — Cursor Changelog · Ryo Lu (Cursor design lead)
💡 Insight — Cursor 将 agent 驱动的开发流程完整搬到了移动端,意味着代码审查和 PR 合并不再受限于桌面。但移动端 UI 如何在有限屏幕中平衡 agent 监控密度与操作便捷性,将成为下一阶段 AI coding 工具差异化的关键战场。