阿里巴巴Qwen宣布Qwen3.8-Max模型在ClinePass订阅中可用,提供约5倍折扣的访问,用户可通过npm i -g cline命令使用
正文内容概括阿里巴巴Qwen宣布Qwen3.8-Max模型在ClinePass订阅中可用,提供约5倍折扣的访问,用户可通过npm i -g cline命令使用。
核心观点提炼常规快讯,保留列表
这期 AIWatch 月度回顾围绕「product、成本优化、ChatGPT」整理本月最值得复盘的模型、产品、工程与行业变化。聚焦 3 · 关注 0 · 跟进 10。
如果只想快速复盘本月变化,先读:阿里巴巴Qwen宣布Qwen3.8-Max模型在ClinePass订阅中可用,提供约5倍折扣的访问,用户可通过npm i -g cline命令使用 → Accomplish_ai和NYU研究人员开源BoundaryBench基准测试,用于评估企业安全策略下代理的真实性能,揭示通用排行榜的误导性 → browser-use 发布新 agent,结合 GPT-5.6 Luna,以 3 美分成本自动浏览 Hacker News 并生成报告。
本月回看「product、成本优化、ChatGPT」,更重要的是判断哪些变化会沉淀为长期基础设施。
正文内容概括阿里巴巴Qwen宣布Qwen3.8-Max模型在ClinePass订阅中可用,提供约5倍折扣的访问,用户可通过npm i -g cline命令使用。
核心观点提炼常规快讯,保留列表
正文内容概括Accomplish_ai和NYU研究人员开源BoundaryBench基准测试,用于评估企业安全策略下代理的真实性能,揭示通用排行榜的误导性。
核心观点提炼常规快讯,保留列表
正文内容概括browser-use 发布新 agent,结合 GPT-5.6 Luna,以 3 美分成本自动浏览 Hacker News 并生成报告。
常规快讯,保留列表
本节暂无内容。
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
摘要由 LLM 生成,请以原文为准。
正文内容概括OpenAI 发布了新一代语音模型 GPT-Live,旨在提升 ChatGPT 语音交互的自然度。该模型现已用于 ChatGPT Voice 功能,为开发者提供了更流畅、更接近真人对话的语音交互能力。
核心观点提炼高信息密度,值得细读
正文内容概括Google 在 Flash 系列基础上发布 Gemini 3.7 Flash,专为编码和智能体任务优化。相比 3.6 Flash,在代码生成、Web 开发、知识工作等基准测试上显著提升,如 FrontierCode 1.1 从 34.4% 升至 43.6%,WebDev Arena Elo 从 1538 升至 1588。同时推出半价优惠,输入 $0.75/1M tokens,输出 $3.75/1M tokens,使开发者能更经济地扩展生产级智能体。模型已集成到 Gemini Spark 等产品中。 核心观点: 1. Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上达 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。 2. 在 WebDev Arena 中 Elo 得分从 1538 升至 1588,生成更功能完整的 Web 应用。 3. AutomationBench 得分从 17.0% 升至 30.4%,企业工作流自动化能力显著增强。
核心观点提炼高信息密度,值得细读
正文内容概括Meta发布了Muse Glimmer开放权重模型(30B参数,Apache 2.0),专为本地代理设计,支持复杂多步骤任务。
核心观点提炼常规快讯,保留列表
正文内容概括Frank Coyle在AIEWF演讲中主张利用本体论作为LLM代理的逻辑护栏,推动神经符号AI复兴。
核心观点提炼常规快讯,保留列表
正文内容概括Augment Code 将 Kimi K3 开源模型集成到其产品家族,用户可在 Cosmos 代理编排平台中尝试。
核心观点提炼常规快讯,保留列表
正文内容概括Runway 宣布 Seedance 2.5 即将在其平台上线,带来视频生成能力的升级。
核心观点提炼常规快讯,保留列表
正文内容概括一项研究测试44个模型发现,要求输出JSON或XML会降低大模型回答的多样性,建议避免使用结构化输出格式以保持丰富性。
核心观点提炼常规快讯,保留列表
正文内容概括Dash 发布了开源 AI Agent 客户端 Cindy,称其完全由 AI 生成,目前尚不完善但将持续改进,面向 AI 原生开发。
核心观点提炼低价值或偏离 AI-Dev