日报 周报 月报 最新一期 2026-07-13 AIWatch 周报 · 历史 WEEKLY · ARCHIVE
精选周刊 06.15 周刊
product / 多模态 / 开放权重 · 06.15 周刊 导语 这期 AIWatch 精选周刊围绕「product、多模态、开放权重」复盘过去一周的关键变化,先给出编辑导读,再把核心精选和延伸内容串成一条可阅读的脉络。聚焦 18 · 关注 4 · 跟进 0。
product 多模态 开放权重
今日阅读路径 如果只想抓住本周主线,先读:Anthropic发布Claude Fable 5与Claude Mythos 5,在软件工程、视觉与科研等领域达到SOTA,并引入新的安全分类器与分层访问机制 → MiniMax 发布开源权重模型 M3,支持 1M 上下文与原生多模态,具备前沿编码与 Agent 能力 → Google 本周发布 Gemma 4 12B 端侧多模态模型、Nano Banana 2/Pro 企业智能体平台、Co-Scientist 科研多智能体系统及 Magenta RealTime 2 实时音乐模型。
本周最值得带走的观察,是「product、多模态、开放权重」已经从单点更新变成连续趋势。
今日头条 精讲 1
产品 Anthropic Newsroom 本月精选 77 /100
正文内容概括 Anthropic 发布 Mythos-class 模型 Claude Fable 5 与 Claude Mythos 5,在软件工程、视觉与科研基准达到 SOTA。Fable 5 面向一般用户,新增网络安全、生物化学与蒸馏分类器,触发时回退至 Claude Opus 4.8;Mythos 5 通过 Project Glasswing 向网络防御者等受信用户开放。开发者可通过 API 调用 claude-fable-5,但需留意保守的安全策略可能导致部分无害请求被拦截,且 Mythos-class 流量实行 30 天数据保留。
核心观点:
1. Fable 5 在 Stripe 的 5000 万行 Ruby 代码库中一日完成原本需团队两月以上的迁移,且在 Cognition FrontierCode 评估中以中等 effort 取得 frontier models 最高分。
2. Fable 5 对网络安全、生物化学及蒸馏查询启用新安全分类器,触发时自动回退至 Claude Opus 4.8,平均触发率低于 5%。
3. Mythos 5 在内部药物设计中将部分流程加速约 10 倍,14 个蛋白靶点中 9 个获得强候选;其分子生物学假设在盲测中被科学家偏好约 80%。
核心观点提炼 重磅首发或硬核洞察
产品 安全分类器 分层访问 软件工程 视觉理解 生命科学
精讲 2
产品 MiniMax @MiniMax_AI 本周精选 74 /100
正文内容概括 MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。
核心观点:
1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。
2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。
3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
核心观点提炼 高信息密度,值得细读
产品 Agent
推荐精选 精选 1
技术 MiniMax @MiniMax_AI 72 /100
正文内容概括 MiniMax 发布 MaxProof 框架,将 Generative-Verifier RL 与 Evolutionary Search 相结合以提升 Test-time Scaling 能力,使其 M3 模型在数学证明任务上超越 human gold-medal threshold。该工作涵盖基座模型优化、验证器对齐、细化能力构建及测试时扩展框架设计,形成完整的数学证明技术路径,为复杂推理与形式化验证的规模化扩展提供了可复现的范式。
核心观点:
1. MaxProof 框架采用 Generative-Verifier RL 与 Evolutionary Search 实现 Test-time Scaling。
2. M3 在数学证明任务上超越 human gold-medal threshold。
3. 技术路径涵盖基座模型优化、验证器对齐、细化能力构建与测试时扩展框架设计四个环节。
核心观点提炼 高信息密度,值得细读
技术 数学证明 Test-time Scaling Generative-Verifier RL Evolutionary Search 推理模型
精选 2
产品 Anthropic Newsroom 72 /100
正文内容概括 Anthropic 与 IT 服务商 DXC 达成多年全球联盟。DXC 将培训数万名 Claude 认证工程师,把 Claude 引入银行、航空、保险等受监管行业的关键业务系统。此前 DXC 已用 Claude 生成其 AI 原生运维平台 OASIS 超 95% 的代码,开发效率提升 10 倍。对开发者而言,这标志着 Claude 正通过大型服务商深度嵌入企业核心系统,并验证了其在代码生成与智能体工作流上的规模化落地能力。
核心观点:
1. DXC 称其 AI 原生平台 OASIS 超 95% 代码由 Claude 生成,开发速度提升 10 倍,已服务逾 50 家客户。
2. OASIS 以 Claude 为默认基础模型驱动智能体工作流,DXC 将培训数万名 Claude 认证工程师嵌入客户组织。
3. 联盟首批落地保险现代化、遗留代码重构(MaaS)、基于 Claude Security 的 SOC 安全子智能体及嵌入式应用维护智能体。
核心观点提炼 高信息密度,值得细读
产品 Claude 智能体工作流
摘要由 LLM 生成,请以原文为准。