日报 周报 月报 最新一期 2026-07-13 AIWatch 周报 · 历史 WEEKLY · ARCHIVE
精选周刊 06.22 周刊
product / Agent / 智能体 · 06.22 周刊 导语 这期 AIWatch 精选周刊围绕「product、Agent、智能体」复盘过去一周的关键变化,先给出编辑导读,再把核心精选和延伸内容串成一条可阅读的脉络。聚焦 2 · 关注 5 · 跟进 10。
product Agent 智能体
今日阅读路径 如果只想抓住本周主线,先读:智谱AI的GLM-5.2模型在OpenRouter上线,支持1M token上下文窗口,面向长时程编码智能体任务 → Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式,专为智能体和长周期编码任务设计 → OpenAI 发布 Deployment Simulation 方法,通过模拟部署使用真实对话数据预测模型行为,提升安全评估准确性。
本周最值得带走的观察,是「product、Agent、智能体」已经从单点更新变成连续趋势。
今日头条 精讲 1
产品 智谱AI @Zai_org 当日精选 71 /100
正文内容概括 智谱AI的旗舰模型GLM-5.2已在OpenRouter平台上线。该模型专为长时程编码智能体任务设计,支持高达1M token的上下文窗口,能够在长且复杂的编码智能体工作中保持可靠性。这对开发者意味着可以处理更长的代码上下文和更复杂的智能体工作流。
核心观点:
1. GLM-5.2支持1M token上下文窗口,专为长时程编码智能体任务优化。
核心观点提炼 高信息密度,值得细读
产品 Agent 长上下文 编码智能体 OpenRouter
精讲 2
产品 智谱AI @Zai_org 当日精选 70 /100
正文内容概括 Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。
核心观点:
1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。
2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
核心观点提炼 高信息密度,值得细读
产品 开源模型 1M上下文窗口 推理模式 智能体 编码
推荐精选 精选 1
技术 OpenAI Blog 72 /100
正文内容概括 OpenAI 提出 Deployment Simulation 方法,利用真实对话数据模拟模型部署后的行为,旨在提升安全评估的准确性。该方法通过模拟实际使用场景,提前预测模型可能的风险,对开发者和研究者而言,有助于在部署前更有效地识别和缓解潜在问题。
核心观点:
1. Deployment Simulation 使用真实对话数据而非合成数据来模拟模型行为。
2. 该方法旨在提升安全评估的准确性,通过预测部署后行为来识别风险。
核心观点提炼 高信息密度,值得细读
技术 安全评估 模型行为预测 对话数据
精选 2
产品 智谱AI @Zai_org 72 /100
正文内容概括 Parasail 平台上线了 GLM-5.2 开放权重模型。该模型在长周期智能体任务上首次显著缩小了与闭源前沿模型的差距,在 FrontierSWE 基准测试中得分超过 GPT-5.5,仅次于 Opus 4.8。这为开发者提供了一个在复杂智能体工作流中接近顶级闭源性能的开源选择。
核心观点:
1. GLM-5.2 在 FrontierSWE 基准上超越 GPT-5.5,仅次于 Opus 4.8。
2. 该模型是首个在长周期智能体任务上接近闭源前沿的开放权重模型。
核心观点提炼 高信息密度,值得细读
产品 开放权重模型 智能体 基准测试 Parasail
精选 3
产品 智谱AI @Zai_org 72 /100
补充速览 速览 1
产品 Anthropic Newsroom 本月精选 77 /100
正文内容概括 Anthropic 发布 Mythos-class 模型 Claude Fable 5 与 Claude Mythos 5,在软件工程、视觉与科研基准达到 SOTA。Fable 5 面向一般用户,新增网络安全、生物化学与蒸馏分类器,触发时回退至 Claude Opus 4.8;Mythos 5 通过 Project Glasswing 向网络防御者等受信用户开放。开发者可通过 API 调用 claude-fable-5,但需留意保守的安全策略可能导致部分无害请求被拦截,且 Mythos-class 流量实行 30 天数据保留。
核心观点:
1. Fable 5 在 Stripe 的 5000 万行 Ruby 代码库中一日完成原本需团队两月以上的迁移,且在 Cognition FrontierCode 评估中以中等 effort 取得 frontier models 最高分。
2. Fable 5 对网络安全、生物化学及蒸馏查询启用新安全分类器,触发时自动回退至 Claude Opus 4.8,平均触发率低于 5%。
3. Mythos 5 在内部药物设计中将部分流程加速约 10 倍,14 个蛋白靶点中 9 个获得强候选;其分子生物学假设在盲测中被科学家偏好约 80%。
核心观点提炼 重磅首发或硬核洞察
产品 安全分类器 分层访问 软件工程 视觉理解 生命科学
速览 2
产品 MiniMax @MiniMax_AI 本周精选 74 /100
正文内容概括 MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。
核心观点:
1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。
2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。
3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
核心观点提炼 高信息密度,值得细读
产品 Agent
摘要由 LLM 生成,请以原文为准。