OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率
正文内容概括OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率。
核心观点提炼常规快讯,保留列表
今天这期 AIWatch 早报围绕「product、tips、开源」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 30 · 关注 0 · 跟进 0。
如果只有 20 分钟,先读:OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率 → Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo → OpenAI 将新语音模式(Jarvis)集成到 Codex 中,现已对所有 ChatGPT 用户开放,并提供了使用指南。
今天的主线不是孤立新闻,而是「product、tips、开源」在不同层面的同步推进。
正文内容概括OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率。
核心观点提炼常规快讯,保留列表
正文内容概括Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 将新语音模式(Jarvis)集成到 Codex 中,现已对所有 ChatGPT 用户开放,并提供了使用指南。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 分享了为 Claude Opus 5 移除 80% Claude Code system prompt 的经验,提供模块化注入开关和编写技巧。
核心观点提炼常规快讯,保留列表
正文内容概括Alex Kotliarskyi 分享了使用 Codex 从图形直接生成工作流脚本的简单实用方法,只需画图并指示 Codex 编写脚本即可自动运行。
核心观点提炼常规快讯,保留列表
正文内容概括BaoCut 发布了视频画面翻译功能,支持 Agent 自动化和导出到剪映,简化了视频翻译工作流。
核心观点提炼常规快讯,保留列表
正文内容概括Perplexity 发布命令行界面(CLI)工具,使编码代理能够直接搜索网络,为开发者提供实时信息检索能力,方便集成到代理工作流中。
核心观点提炼常规快讯,保留列表
正文内容概括Atomic Agent 是一款基于 MIT 许可证的开源 Agent 运行时。在 GAIA Level 1 基准测试中,使用相同的 4-bit qwen-3.6-35b 模型和 Apple M4 Max 硬件,Atomic Agent 以 69.8% 的准确率击败 Hermes 的 58.5%,且速度快 1.6 倍(3h12m vs 5h10m)。这一结果展示了开源 Agent 运行时的性能潜力,为开发者提供了更高效的选择。 核心观点: 1. Atomic Agent 在 GAIA Level 1 准确率 69.8%,比 Hermes 的 58.5% 高 11.3 个百分点。 2. 相同硬件和模型下,Atomic Agent 完成 53 任务耗时 3h12m,比 Hermes 快 1.6 倍。 3. Atomic Agent 解决 37/53 任务,Hermes 解决 31/53,多解决 6 个。
核心观点提炼高信息密度,值得细读
正文内容概括Thariq 分享了移除约80%的Claude Code系统提示后学到的编写系统提示、技能和Claude.MDs的经验,为开发者优化提示提供参考。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 砍掉了 Claude Code 80% 的系统提示,总结出少写规则、按需加载技能的新范式,使模型更稳定高效。
核心观点提炼常规快讯,保留列表
正文内容概括提供玻利维亚区Google Play订阅ChatGPT的详细步骤、避坑注意与风险提示,并转述黄仁勋关于开放模型的公开信。
核心观点提炼常规快讯,保留列表
正文内容概括Dari 发布开源路由器模型,通过智能路由和缓存决策在 Terminal-Bench 上以 76 美元成本达到 79.8% 准确率,大幅降低推理费用。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 推出 ChatGPT Work 功能,用户可通过手机创建和发布网站,并访问云电脑、终端、代码执行等开发工具。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic产品设计师Nate Parrott介绍了Claude Design工具,用于在设计前通过HTML交互原型探索想法,加速设计流程。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 为 ChatGPT Work agent 新增支持登录网站的功能,用户可接管云浏览器登录并让 agent 继续任务,登录状态跨会话持久化。
核心观点提炼常规快讯,保留列表
正文内容概括OpenRouter 推出 Classifiers 测试版,支持按任务类型等标签推理并可视化路由活动。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic与Andon Labs通过Project Pilot评估AI控制无人机执行定位跟踪任务,并发布Drone-Bench基准,展示能力进步与安全风险。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 在 ChatGPT 中为所有付费用户推出了一个 15GB RAM 9 核的虚拟机,自带浏览器并可安装包,让非技术人员也能使用远程机器运行 agent。
核心观点提炼常规快讯,保留列表
正文内容概括Google 在 AI Studio 上推出 TICKR 应用,并发布托管代理快速入门文档,为 Gemini API 代理开发提供指南。
核心观点提炼常规快讯,保留列表
正文内容概括Canvas UI 发布了基于 Chrome 实验性 HTML-in-Canvas 的交互式 DOM+WebGL 组件库,支持多框架并面向 AI 代理分发,为前端开发带来新可能。
核心观点提炼常规快讯,保留列表
正文内容概括黑森林工作室预告FLUX 3全模态生成模型,支持图像/视频/音频/动作生成,单条视频20秒,并暗示可能开源。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 为 ChatGPT 桌面端加入语音控制,基于全双工 GPT-Live 模型,支持语音操控电脑和编写代码,提升交互效率。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 ChatGPT 健康功能,允许美国用户连接医疗记录和 Apple Health,以获取个性化健康洞察。
核心观点提炼常规快讯,保留列表
正文内容概括第三方评测在 DeepSWE 基准上对比 Kimi K3 max 与 GPT-5.6 Sol max,两者各有所长:Kimi 在多次尝试(pass@2/4)、成本、Rust 和运维领域占优;Sol 在单次(pass@1)、速度、Python/TS/JS 和序列化等领域占优。任务级相关低(0.46),失败模式不同,推荐级联使用。先 Kimi 再 Sol 的级联策略可达 85.6% 解题率,成本 $7.30/任务,比单独 Sol 覆盖高 13 个百分点且成本更低,为开发者提供高效低成本方案。 核心观点: 1. pass@2/4 上 Kimi 反超 GPT,多次尝试优势明显(Kimi pass@4 89.4% vs GPT 85.8%)。 2. Kimi 成本仅为 GPT 约 55%($4.65 vs $8.37),每 $100 解题数近 3 倍(14.7 vs 5.3)。 3. 级联策略(先 Kimi 再 Sol)实现 85.6% 解题率,成本 $7.30,比单独 Sol 覆盖高 13 个百分点。
核心观点提炼高信息密度,值得细读
正文内容概括吴恩达团队开源桌面端AI Agent OpenWorker,定位为交付完整工作的AI同事,但评论认为其与现有项目差异不大。
核心观点提炼常规快讯,保留列表
正文内容概括NVIDIA AI 展示了使用 PrimeIntellect Lab 进行强化学习训练,将 Nemotron 3 Nano 在数学任务上的准确率从 22% 提升至 91%,成本不到 5 美元。
核心观点提炼常规快讯,保留列表
正文内容概括Black Forest Labs 发布并开源 Flux 3 视频生成模型,支持文生视频、图生视频、视频参考生成、视频与音频延长、关键帧控制、多语言对话、智能剪辑、文字与动画及图像输出等多种功能。目前模型仅限早期访问申请,未来几周将开放 API 访问,随后开源 Flux 3 Dev 版本。开发者可提前申请体验,为视频生成应用提供新选择。 核心观点: 1. Flux 3 支持文生视频、图生视频及视频参考生成,可基于参考片段生成新视频。 2. 模型提供关键帧控制、智能剪辑和文字动画生成等高级功能。 3. Flux 3 Dev 模型将开源,但当前仅限早期访问,API 将在未来几周开放。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 为 Claude 语音模式加入 Opus 和 Sonnet 模型及多语言支持,使用户能通过语音进行更深入的思考和问题解决。
核心观点提炼常规快讯,保留列表
正文内容概括claude-tap 作为 Coding Agent 的本地可观测性平台,展示了系统提示、工具调用等运行时细节,有助于学习 Agent Harness Engineering。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI Labs 发布了 Fugu-Ultra v1.1,整合前沿模型并在编程和终端任务等基准上取得最高 7.9 分的性能提升。
核心观点提炼常规快讯,保留列表
本节暂无内容。
本节暂无内容。
摘要由 LLM 生成,请以原文为准。