今天这期 AIWatch 早报围绕「product、discussion、GPT」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 5 · 关注 0 · 跟进 10。
如果只有 20 分钟,先读:Ethan Mollick 让 GPT-5.6 Sol in Codex 控制其电脑并成功赢得游戏《Slay the Spire 2》的每日挑战,展示了 AI 代理的自主决策能力 → JT-4.1 Flash 在 AA-Omniscience 指数上得分为 -10.1,准确率 23%,幻觉率 43% → Sakana AI 以 VLM-agent 非交互方式重现 Picbreeder,作者评论认为这是 AI 最重要研究方向之一,并指出 LLM 自动化面临收敛与抽象理解问题。
今天的主线不是孤立新闻,而是「product、discussion、GPT」在不同层面的同步推进。
正文内容概括Ethan Mollick 让 GPT-5.6 Sol in Codex 控制其电脑并成功赢得游戏《Slay the Spire 2》的每日挑战,展示了 AI 代理的自主决策能力。
核心观点提炼常规快讯,保留列表
正文内容概括JT-4.1 Flash 在 AA-Omniscience 指数上得分为 -10.1,准确率 23%,幻觉率 43%。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI 以 VLM-agent 非交互方式重现 Picbreeder,作者评论认为这是 AI 最重要研究方向之一,并指出 LLM 自动化面临收敛与抽象理解问题。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 Sol Ultra 正式可用,Ethan Knight 称其用 64 个子代理在一小时内证明了 50 年未解的 Cycle Double Cover 猜想,而 Dan Shipper 则调侃自己花费 2b tokens 未能解决。
核心观点提炼常规快讯,保留列表
正文内容概括JT-4.1 Flash 作为非推理模型每个智能指数任务使用约 14k tokens,效率较高但未达到智能与输出 token 的帕累托前沿。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括两个香港学生通过在外层循环上再套一个循环,将Karpathy的自动研究框架提速5倍,未更换模型或增加算力。
核心观点提炼常规快讯,保留列表
正文内容概括LangChain 分享了在 Deep Agents 中调优 Nemotron 3 Ultra 的实践,展示了如何通过调整智能体框架而非模型本身来提升性能。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 在 DeepSWE 排行榜上以 73% 的成绩领先,并公布了 Sol、Terra 和 Luna 的结果。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布 ChatGPT Work 功能说明,指出云端与桌面工作数据隔离。
核心观点提炼常规快讯,保留列表
正文内容概括Magic Patterns 集成了 OpenAI 的 GPT-5.6,早期评估显示其 token 效率提升且设计能力优于 GPT-5.5。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT 新版语音模式新增可视化卡片功能,在对话中展示搜索结果细节,提升交互体验。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 Sol (max) 在由阿贡和UIUC开发的CritPt基准测试中超越前代和Claude Fable 5,成为研究生级物理问题的新领先者,显示其前沿科研潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Cohere 发布基于 mlx-audio 的本地阿拉伯语转录功能,可在 MacBook 上运行,用于会议记录和语音笔记。
核心观点提炼常规快讯,保留列表
正文内容概括JetBrains 将 OpenAI 的 GPT 5.6 集成到其 IDE、Junie 和 Air 产品中,并演示了用模糊 CEO 消息快速构建实用工具的能力。
核心观点提炼常规快讯,保留列表
正文内容概括Replit 宣布现有项目可迁移至 Clerk 认证,并支持自定义注册体验,开发者可定制界面且用户无需 Replit 账户。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。