RT AYi: 两个香港学生,把Karpathy的自动研究框架干到了5倍速。 没换更强的模型,也没加更多算力,甚至代码都没怎么改。 只是在原来的循环上面,又套了一个循环...
正文内容概括两个香港学生通过在外层循环上再套一个循环,将Karpathy的自动研究框架提速5倍,未更换模型或增加算力。
核心观点提炼常规快讯,保留列表
今天这期 AIWatch 早报围绕「product、tips、GPT」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 14 · 关注 0 · 跟进 10。
如果只有 20 分钟,先读:RT AYi: 两个香港学生,把Karpathy的自动研究框架干到了5倍速。 没换更强的模型,也没加更多算力,甚至代码都没怎么改。 只是在原来的循环上面,又套了一个循环... → LangChain 分享了在 Deep Agents 中调优 Nemotron 3 Ultra 的实践,展示了如何通过调整智能体框架而非模型本身来提升性能 → GPT-5.6 在 DeepSWE 排行榜上以 73% 的成绩领先,并公布了 Sol、Terra 和 Luna 的结果。
今天的主线不是孤立新闻,而是「product、tips、GPT」在不同层面的同步推进。
正文内容概括两个香港学生通过在外层循环上再套一个循环,将Karpathy的自动研究框架提速5倍,未更换模型或增加算力。
核心观点提炼常规快讯,保留列表
正文内容概括LangChain 分享了在 Deep Agents 中调优 Nemotron 3 Ultra 的实践,展示了如何通过调整智能体框架而非模型本身来提升性能。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 在 DeepSWE 排行榜上以 73% 的成绩领先,并公布了 Sol、Terra 和 Luna 的结果。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布 ChatGPT Work 功能说明,指出云端与桌面工作数据隔离。
核心观点提炼常规快讯,保留列表
正文内容概括Magic Patterns 集成了 OpenAI 的 GPT-5.6,早期评估显示其 token 效率提升且设计能力优于 GPT-5.5。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT 新版语音模式新增可视化卡片功能,在对话中展示搜索结果细节,提升交互体验。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 Sol (max) 在由阿贡和UIUC开发的CritPt基准测试中超越前代和Claude Fable 5,成为研究生级物理问题的新领先者,显示其前沿科研潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Cohere 发布基于 mlx-audio 的本地阿拉伯语转录功能,可在 MacBook 上运行,用于会议记录和语音笔记。
核心观点提炼常规快讯,保留列表
正文内容概括JetBrains 将 OpenAI 的 GPT 5.6 集成到其 IDE、Junie 和 Air 产品中,并演示了用模糊 CEO 消息快速构建实用工具的能力。
核心观点提炼常规快讯,保留列表
正文内容概括Replit 宣布现有项目可迁移至 Clerk 认证,并支持自定义注册体验,开发者可定制界面且用户无需 Replit 账户。
核心观点提炼常规快讯,保留列表
正文内容概括dotey 分享了 Agent 的 /goal 功能使用技巧,通过设定目标、验证和停止条件,实现长时间运行任务,并给出性能优化示例。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 发布会话间通信功能,允许不同会话自主发送摘要以协调任务,避免重复解释,提升多会话协作效率。
核心观点提炼常规快讯,保留列表
正文内容概括Pika Labs 宣布 MiniMax 最新模型 H3 已在 Pika MCP 平台正式上线,开发者可立即集成使用,为 AI 应用开发提供新的能力和更多可能性。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 将于下周默认开启自动模式,该模式通过多层防御将间接提示注入攻击降至接近零。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
正文内容概括Addy Osmani 提出工程师应守住 AI 代码生成的外环问责,强调质量、裁决与可交代性,并指出信任-验证缺口与认知成本。
核心观点提炼常规快讯,保留列表
正文内容概括Justin Uberti 展示了 GPT-Live 作为队友玩 Taboo 游戏,体现了快速来回对话和同时听说能力。
核心观点提炼常规快讯,保留列表
正文内容概括Zed 发布了基于 DeltaDB 的协作编码功能,支持团队共同提示 AI agent 并实时审查更改,旨在简化开发协作。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 指出其 Astra 模型可能达到“Critical”安全能力阈值,暂停不符合新安全要求的开发工作并加强防护。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 宣布 Auto 模式将成为 Pro/Max/Team 用户的默认权限模式,该模式通过单独分类器审查命令,测试中捕获了 89% 的危险命令。
核心观点提炼常规快讯,保留列表
正文内容概括Simon Willison 使用 Codex 和 GPT-5.6 Sol Ultra 生成游戏《Moonlight & Mayhem》,发现并修复了浣熊眼睛的 bug,展示了 AI 编码代理的能力与局限。
核心观点提炼常规快讯,保留列表
正文内容概括博主分享在Claude Code中挂载Codex订阅,用Fable 5做决策、GPT 5.5做执行的双模型分工工作流,声称可节省60% token消耗。
核心观点提炼常规快讯,保留列表
正文内容概括Google 发布了 Gemini Omni Flash 模型,支持从文本、图像、视频或音频参考创建和编辑高质量视频,为开发者提供视频生成能力。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。