今天这期 AIWatch 早报围绕「product、tips、开源」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 30 · 关注 0 · 跟进 2。
如果只有 20 分钟,先读:OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率 → Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo → Alex Kotliarskyi 分享了使用 Codex 从图形直接生成工作流脚本的简单实用方法,只需画图并指示 Codex 编写脚本即可自动运行。
今天的主线不是孤立新闻,而是「product、tips、开源」在不同层面的同步推进。
正文内容概括OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率。
核心观点提炼常规快讯,保留列表
正文内容概括Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo。
核心观点提炼常规快讯,保留列表
正文内容概括Alex Kotliarskyi 分享了使用 Codex 从图形直接生成工作流脚本的简单实用方法,只需画图并指示 Codex 编写脚本即可自动运行。
核心观点提炼常规快讯,保留列表
正文内容概括BaoCut 发布了视频画面翻译功能,支持 Agent 自动化和导出到剪映,简化了视频翻译工作流。
核心观点提炼常规快讯,保留列表
正文内容概括Perplexity 发布命令行界面(CLI)工具,使编码代理能够直接搜索网络,为开发者提供实时信息检索能力,方便集成到代理工作流中。
核心观点提炼常规快讯,保留列表
正文内容概括Atomic Agent 是一款基于 MIT 许可证的开源 Agent 运行时。在 GAIA Level 1 基准测试中,使用相同的 4-bit qwen-3.6-35b 模型和 Apple M4 Max 硬件,Atomic Agent 以 69.8% 的准确率击败 Hermes 的 58.5%,且速度快 1.6 倍(3h12m vs 5h10m)。这一结果展示了开源 Agent 运行时的性能潜力,为开发者提供了更高效的选择。 核心观点: 1. Atomic Agent 在 GAIA Level 1 准确率 69.8%,比 Hermes 的 58.5% 高 11.3 个百分点。 2. 相同硬件和模型下,Atomic Agent 完成 53 任务耗时 3h12m,比 Hermes 快 1.6 倍。 3. Atomic Agent 解决 37/53 任务,Hermes 解决 31/53,多解决 6 个。
核心观点提炼高信息密度,值得细读
正文内容概括Thariq 分享了移除约80%的Claude Code系统提示后学到的编写系统提示、技能和Claude.MDs的经验,为开发者优化提示提供参考。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 砍掉了 Claude Code 80% 的系统提示,总结出少写规则、按需加载技能的新范式,使模型更稳定高效。
核心观点提炼常规快讯,保留列表
正文内容概括提供玻利维亚区Google Play订阅ChatGPT的详细步骤、避坑注意与风险提示,并转述黄仁勋关于开放模型的公开信。
核心观点提炼常规快讯,保留列表
正文内容概括Dari 发布开源路由器模型,通过智能路由和缓存决策在 Terminal-Bench 上以 76 美元成本达到 79.8% 准确率,大幅降低推理费用。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 推出 ChatGPT Work 功能,用户可通过手机创建和发布网站,并访问云电脑、终端、代码执行等开发工具。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic产品设计师Nate Parrott介绍了Claude Design工具,用于在设计前通过HTML交互原型探索想法,加速设计流程。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 为 ChatGPT Work agent 新增支持登录网站的功能,用户可接管云浏览器登录并让 agent 继续任务,登录状态跨会话持久化。
核心观点提炼常规快讯,保留列表
正文内容概括OpenRouter 推出 Classifiers 测试版,支持按任务类型等标签推理并可视化路由活动。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic与Andon Labs通过Project Pilot评估AI控制无人机执行定位跟踪任务,并发布Drone-Bench基准,展示能力进步与安全风险。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 在 ChatGPT 中为所有付费用户推出了一个 15GB RAM 9 核的虚拟机,自带浏览器并可安装包,让非技术人员也能使用远程机器运行 agent。
核心观点提炼常规快讯,保留列表
正文内容概括Google 在 AI Studio 上推出 TICKR 应用,并发布托管代理快速入门文档,为 Gemini API 代理开发提供指南。
核心观点提炼常规快讯,保留列表
正文内容概括Canvas UI 发布了基于 Chrome 实验性 HTML-in-Canvas 的交互式 DOM+WebGL 组件库,支持多框架并面向 AI 代理分发,为前端开发带来新可能。
核心观点提炼常规快讯,保留列表
正文内容概括黑森林工作室预告FLUX 3全模态生成模型,支持图像/视频/音频/动作生成,单条视频20秒,并暗示可能开源。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 为 ChatGPT 桌面端加入语音控制,基于全双工 GPT-Live 模型,支持语音操控电脑和编写代码,提升交互效率。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 ChatGPT 健康功能,允许美国用户连接医疗记录和 Apple Health,以获取个性化健康洞察。
核心观点提炼常规快讯,保留列表
正文内容概括第三方评测在 DeepSWE 基准上对比 Kimi K3 max 与 GPT-5.6 Sol max,两者各有所长:Kimi 在多次尝试(pass@2/4)、成本、Rust 和运维领域占优;Sol 在单次(pass@1)、速度、Python/TS/JS 和序列化等领域占优。任务级相关低(0.46),失败模式不同,推荐级联使用。先 Kimi 再 Sol 的级联策略可达 85.6% 解题率,成本 $7.30/任务,比单独 Sol 覆盖高 13 个百分点且成本更低,为开发者提供高效低成本方案。 核心观点: 1. pass@2/4 上 Kimi 反超 GPT,多次尝试优势明显(Kimi pass@4 89.4% vs GPT 85.8%)。 2. Kimi 成本仅为 GPT 约 55%($4.65 vs $8.37),每 $100 解题数近 3 倍(14.7 vs 5.3)。 3. 级联策略(先 Kimi 再 Sol)实现 85.6% 解题率,成本 $7.30,比单独 Sol 覆盖高 13 个百分点。
核心观点提炼高信息密度,值得细读
正文内容概括吴恩达团队开源桌面端AI Agent OpenWorker,定位为交付完整工作的AI同事,但评论认为其与现有项目差异不大。
核心观点提炼常规快讯,保留列表
正文内容概括NVIDIA AI 展示了使用 PrimeIntellect Lab 进行强化学习训练,将 Nemotron 3 Nano 在数学任务上的准确率从 22% 提升至 91%,成本不到 5 美元。
核心观点提炼常规快讯,保留列表
正文内容概括Black Forest Labs 发布并开源 Flux 3 视频生成模型,支持文生视频、图生视频、视频参考生成、视频与音频延长、关键帧控制、多语言对话、智能剪辑、文字与动画及图像输出等多种功能。目前模型仅限早期访问申请,未来几周将开放 API 访问,随后开源 Flux 3 Dev 版本。开发者可提前申请体验,为视频生成应用提供新选择。 核心观点: 1. Flux 3 支持文生视频、图生视频及视频参考生成,可基于参考片段生成新视频。 2. 模型提供关键帧控制、智能剪辑和文字动画生成等高级功能。 3. Flux 3 Dev 模型将开源,但当前仅限早期访问,API 将在未来几周开放。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 为 Claude 语音模式加入 Opus 和 Sonnet 模型及多语言支持,使用户能通过语音进行更深入的思考和问题解决。
核心观点提炼常规快讯,保留列表
正文内容概括claude-tap 作为 Coding Agent 的本地可观测性平台,展示了系统提示、工具调用等运行时细节,有助于学习 Agent Harness Engineering。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI Labs 发布了 Fugu-Ultra v1.1,整合前沿模型并在编程和终端任务等基准上取得最高 7.9 分的性能提升。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 在 ChatGPT 桌面应用中推出语音控制功能,支持用语音指挥多个 agent 并协调工作。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI Codex 发布了多文件夹支持功能,允许一个项目跨多个本地文件夹读写,主文件夹仍为 Git 根。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括ChatGPT 现已支持构建和发布完整 Web 应用,并附有教程视频演示。
核心观点提炼常规快讯,保留列表
正文内容概括腾讯混元发布了Hy3模型的GGUF量化版本,支持llama.cpp直接运行和MTP自推测解码,方便开发者部署。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。