谷歌在 Gemini 3.5 Flash 模型中引入了计算机使用能力,使模型能够直接操控桌面应用和浏览器。这一功能拓展了多模态交互的边界,允许开发者构建能够像人类一样操作界面的智能体应用。对开发者而言,这意味着可以基于该能力开发自动化工作流、测试脚本或辅助工具,但需注意模型在复杂界面中的稳定性和安全性。 核心观点: 1. Gemini 3.5 Flash 新增计算机使用能力,可直接操控桌面应用和浏览器。 2. 该能力拓展了多模态交互边界,支持开发者构建自动化界面操作智能体。
Parasail 平台上线了 GLM-5.2 开放权重模型。该模型在长周期智能体任务上首次显著缩小了与闭源前沿模型的差距,在 FrontierSWE 基准测试中得分超过 GPT-5.5,仅次于 Opus 4.8。这为开发者提供了一个在复杂智能体工作流中接近顶级闭源性能的开源选择。 核心观点: 1. GLM-5.2 在 FrontierSWE 基准上超越 GPT-5.5,仅次于 Opus 4.8。 2. 该模型是首个在长周期智能体任务上接近闭源前沿的开放权重模型。
Zai_org 发布了其旗舰模型 GLM-5.2,该模型已在 Nebius Token Factory 平台上线并获得 Day 0 支持。新模型在编码能力、智能体能力和长上下文执行方面有显著提升,旨在满足高要求的工程工作流需求。 核心观点: 1. GLM-5.2 在 Nebius Token Factory 获得 Day 0 支持,即发布当天即可使用。 2. 新模型在编码、智能体能力和长上下文执行方面有提升。
Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。 核心观点: 1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。 2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
Kimi 发布并开源了 K2.7-Code 模型,针对编码智能体常见的“过度思考”问题进行了优化,相比上一代减少 30% token 消耗。在多项基准测试中性能显著提升:Kimi Code Bench v2 提高 21.8%,Program Bench 提高 11%,MLS Bench Lite 提高 31.5%。模型权重和代码已开源至 Hugging Face,同时预告了即将推出的 6x 高速模式。开发者可通过开放 API 和 Kimi Code 立即使用,并参与 Beta 计划体验新功能。 核心观点: 1. K2.7-Code 通过减少过度思考,在长任务智能体场景下 token 消耗降低 30%,同时 agent 长任务成功率反而提升。 2. Kimi Code Bench v2 提升 21.8%、Program Bench 提升 11%、MLS Bench Lite 提升 31.5%,指令跟随和端到端完成率均有改善。 3. 模型权重和代码已开源至 Hugging Face,并预告即将推出 6x High-Speed Mode 以进一步提升编码效率。
OpenAI 收购 Ona,为 Codex 智能体构建持久化安全云工作空间,解决复杂任务无人值守时中断的问题。Ona 提供受控环境,使智能体能运行命令、保存上下文并在笔记本关闭后恢复工作,满足企业级安全需求。此举将 Codex 从对话工具扩展为可执行测试、修复、重构等长时任务的托管执行层,为开发者提供更可靠的自动化基础设施。 核心观点: 1. Codex 周活用户已达 500 万,增长 400%,显示智能体需求快速扩张。 2. Ona 提供持久化云工作空间,使智能体能在笔记本关闭后继续运行命令并恢复上下文。 3. 收购目标为企业场景:支持在自有云边界内部署智能体,提供限定凭证、审查跟踪与可审计活动。
Google 本周密集发布多款 AI 产品。Gemma 4 12B 作为统一的 encoder-free 多模态模型,支持笔记本端完全离线运行,并通过 Quantization-Aware Training (QAT) 降低内存占用;Nano Banana 2 与 Nano Banana Pro 企业智能体平台正式商用;Co-Scientist 科研多智能体系统可生成并优化科学假设;Magenta RealTime 2 开放权重实时音乐模型支持 MIDI 与手势交互。对开发者而言,端侧部署与企业智能体工具链得到显著增强。 核心观点: 1. Gemma 4 12B 采用 encoder-free 架构,支持笔记本完全离线运行多模态任务。 2. Gemma 4 及其 drafters 经 Quantization-Aware Training (QAT) 优化,可降低内存需求并最大化端侧性能。 3. Magenta RealTime 2 为开放权重实时音乐模型,支持通过 MIDI 键盘、文本提示和手势进行演奏交互。