今天这期 AIWatch 早报围绕「product、tips、discussion」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 20 · 关注 0 · 跟进 10。
如果只有 20 分钟,先读:OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力 → Claude 开发者官方分享:团队内部高频使用这两种经典多智能体模式「Advisor」和「Orchestrator」来发挥 Fable 5 最高价值、同时把成本降到最低! # 模式一:Advi... → 推荐 Addy Osmani 最新分享「Own the Outer Loop」 Agent 可以写代码,但工程师必须守住边界上的决定与后果! 过去一年,大家谈 harness、loop、fleet、software...。
今天的主线不是孤立新闻,而是「product、tips、discussion」在不同层面的同步推进。
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
正文内容概括Addy Osmani 提出工程师应守住 AI 代码生成的外环问责,强调质量、裁决与可交代性,并指出信任-验证缺口与认知成本。
核心观点提炼常规快讯,保留列表
正文内容概括Justin Uberti 展示了 GPT-Live 作为队友玩 Taboo 游戏,体现了快速来回对话和同时听说能力。
核心观点提炼常规快讯,保留列表
正文内容概括Zed 发布了基于 DeltaDB 的协作编码功能,支持团队共同提示 AI agent 并实时审查更改,旨在简化开发协作。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 指出其 Astra 模型可能达到“Critical”安全能力阈值,暂停不符合新安全要求的开发工作并加强防护。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 宣布 Auto 模式将成为 Pro/Max/Team 用户的默认权限模式,该模式通过单独分类器审查命令,测试中捕获了 89% 的危险命令。
核心观点提炼常规快讯,保留列表
正文内容概括Simon Willison 使用 Codex 和 GPT-5.6 Sol Ultra 生成游戏《Moonlight & Mayhem》,发现并修复了浣熊眼睛的 bug,展示了 AI 编码代理的能力与局限。
核心观点提炼常规快讯,保留列表
正文内容概括博主分享在Claude Code中挂载Codex订阅,用Fable 5做决策、GPT 5.5做执行的双模型分工工作流,声称可节省60% token消耗。
核心观点提炼常规快讯,保留列表
正文内容概括Google 发布了 Gemini Omni Flash 模型,支持从文本、图像、视频或音频参考创建和编辑高质量视频,为开发者提供视频生成能力。
核心观点提炼常规快讯,保留列表
正文内容概括GitHub 宣布 Kimi K3 开放权重模型在 Copilot 中正式可用,具备前沿的 agentic coding 能力且成本效益高。
核心观点提炼常规快讯,保留列表
正文内容概括博主用豆包AI制作了治愈故事短片《逃亡的文件》,通过详细提示词展示了文件从回收站逃出并在键盘、咖啡杯、笔记本等场景奇幻旅程的创作过程。
核心观点提炼常规快讯,保留列表
正文内容概括MiniMax 开源模型权重后,社区四天内构建出蒸馏 LoRA,将采样步骤从20步降至4-8步,大幅加速推理。
核心观点提炼常规快讯,保留列表
正文内容概括AINews 报道 AMD 收购 Taalas、Meta 模型达金牌水平、OpenAI 统一模型并推免费层、Agent 插件标准发布,推动推理硬件、模型能力和开发工具生态发展。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 Codex Security Review 研究预览,为 GitHub 拉取请求提供基于威胁模型的安全审查,帮助开发者发现高严重性安全问题。
核心观点提炼常规快讯,保留列表
正文内容概括Higgsfield AI 开源了 95 分钟 AI 电影《Hell Grind》的提示词和素材,该片成本 50 万美元并在戛纳放映,展示了 AI 长片制作的潜力。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI、AWS、Cursor、GitHub、VS Code和Vercel等厂商联合发布了Agent Plugins开放标准,将Agent Skills和MCP配置打包为可移植插件,实现一次构建多客户端通用。
核心观点提炼常规快讯,保留列表
正文内容概括Replicate 上线了 Seedream 5.0 Pro,支持基于区域的编辑、故事板、多层图像分离及最多10张参考图生成。
核心观点提炼常规快讯,保留列表
正文内容概括Theo 透露 GPT-5.6 模型已可讨论,称其比 5.5 大幅改进,擅长子智能体编排和 iOS 开发,但仍不如 Fable 智能。
核心观点提炼常规快讯,保留列表
正文内容概括Kling AI 发布了 MCP 和 CLI,使 AI 代理能直接调用 Kling 视频生成模型,无需切换工具,提升创作效率。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括Browser Use Cloud 与 Coinbase 合作推出 x402 支付协议,让 AI 代理能用 USDC 自主支付 API 请求,无需人类注册或密钥。
核心观点提炼常规快讯,保留列表
正文内容概括GitHub 发布了 Copilot 应用的斜杠命令指南,帮助开发者通过 /plan、/spar 等命令高效管理开发工作流。
核心观点提炼常规快讯,保留列表
正文内容概括字节跳动发布 Seedream 5.0 Pro 图像生成模型,支持文本生成和最多 10 张参考图像引导,提供 1K/2K 分辨率,定价每张 0.045-0.09 美元。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 联合 AWS、Cursor、GitHub 等发布 Agent Plugins 开放标准,使开发者一次构建插件即可在 ChatGPT、Codex 等代理中通用。
核心观点提炼常规快讯,保留列表
正文内容概括PocketJS 发布了 Pocket Pi,在 ESP32 上实现满血运行的 pi harness,支持对话、工具调用和 agent 循环,将 AI agent 带入嵌入式设备。
核心观点提炼常规快讯,保留列表
正文内容概括Seedream 5.0 Pro 发布,强调从生成到设计的能力升级,旨在释放专业生产力。
核心观点提炼常规快讯,保留列表
正文内容概括UnslothAI 发布 DSpark 工具,使 DeepSeek-V4-Flash-0731 的 GGUF 模型本地推理速度提升 1.4–2 倍,精度不变,可达 120 tokens/s。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI 发布了 Sakana Marlin,一个能自主进行数小时研究的 AI 模型,基于 AB-MCTS 和 AI Scientist 技术,推动自主推理能力。
核心观点提炼常规快讯,保留列表
正文内容概括Meta声称Muse Spark 1.2与Muse agent harness共同训练,Cline团队从中提取系统提示指令应用到自身harness。在修复真实bug任务中,修改后的harness相比原始版本token减少2.7倍(19.7M→7.2M),速度提升2倍(49min→24min),成本降低2.4倍($7.69→$3.25)。这表明系统提示对agent性能影响巨大,提示工程可带来显著提升。 核心观点: 1. 提取指令强调信任源代码、重视边缘案例、修复前重现bug、持续验证完成。 2. 相同模型Muse Spark 1.2下,仅改变提示使token减少2.7倍、速度提升2倍、成本降低2.4倍。
核心观点提炼高信息密度,值得细读
正文内容概括Google重组DeepMind领导层,Hassabis转任主席和首席科学家专注AGI,Kavukcuoglu接管运营并确认Gemini 4开发中。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。