精讲 1
产品Google DeepMind Blog本周精选71/100
正文内容概括Google 在 Flash 系列基础上发布 Gemini 3.7 Flash,专为编码和智能体任务优化。相比 3.6 Flash,在代码生成、Web 开发、知识工作等基准测试上显著提升,如 FrontierCode 1.1 从 34.4% 升至 43.6%,WebDev Arena Elo 从 1538 升至 1588。同时推出半价优惠,输入 $0.75/1M tokens,输出 $3.75/1M tokens,使开发者能更经济地扩展生产级智能体。模型已集成到 Gemini Spark 等产品中。
核心观点:
1. Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上达 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。
2. 在 WebDev Arena 中 Elo 得分从 1538 升至 1588,生成更功能完整的 Web 应用。
3. AutomationBench 得分从 17.0% 升至 30.4%,企业工作流自动化能力显著增强。
核心观点提炼高信息密度,值得细读
产品编码智能体成本优化基准测试Web开发
精讲 2
产品AI at Meta @AIatMeta本周精选72/100
正文内容概括Meta发布了Muse Glimmer开放权重模型(30B参数,Apache 2.0),专为本地代理设计,支持复杂多步骤任务。
核心观点提炼常规快讯,保留列表
产品
精讲 3
产品Simon Willison当日精选64/100
正文内容概括阿里Qwen实验室发布Qwen 3.8 27B开源模型,默认推理开销极高导致本地生成耗时数十分钟,但模型在视觉和代码生成上表现出色。
核心观点提炼常规快讯,保留列表
产品
精讲 4
技巧Martin Alderson当日精选65/100
正文内容概括Martin Alderson 提出了降低 AI 推理成本的系统方法,包括成本审计、模型替换和 Agent 优化,可帮助团队显著减少开支。
核心观点提炼常规快讯,保留列表
技巧
精讲 5
产品Claude Devs @ClaudeDevs当日精选63/100
正文内容概括Claude Code 的 /code-review 命令新增 effort 级别,低级别以更低 token 成本超越其他工具,高级别提供更高召回率。
核心观点提炼常规快讯,保留列表
产品
精讲 6
产品Unsloth AI @UnslothAI当日精选64/100
正文内容概括Google对Gemma 4进行了重大改进,提升了工具调用和聊天准确性、可靠性和速度,并提供了更新后的量化版本。
核心观点提炼常规快讯,保留列表
产品
精讲 7
产品宝玉 @dotey当日精选60/100
正文内容概括狗哥笔记正式开源拼贴动画B-roll Skill,基于Codex和Gemini Omni Flash实现从口播文稿到竖版拼贴动画的自动化生成工作流。
核心观点提炼常规快讯,保留列表
产品
精讲 8
讨论Latent Space当日精选62/100
正文内容概括AIE World's Fair 2026 指出 AI 工程进入新阶段,从用 agent 构建转向围绕 agent 构建系统。
核心观点提炼常规快讯,保留列表
讨论
精讲 9
讨论Google DeepMind @GoogleDeepMind当日精选64/100
正文内容概括Google DeepMind 发布文章探讨 AI 代理在科学发现中从提出假设到设计实验的潜力,指出验证瓶颈并提出四项政策优先事项。
核心观点提炼常规快讯,保留列表
讨论
精讲 10
产品NVIDIA AI @NVIDIAAI当日精选65/100
正文内容概括NVIDIA 发布了 ARDY 实时 AI 动画工具,用户可通过文本描述生成角色动作序列,并在 Hugging Face Spaces 上试用。
核心观点提炼常规快讯,保留列表
产品
精讲 11
产品Tibo Sottiaux @thsottiaux当日精选59/100
正文内容概括OpenAI宣布Codex和ChatGPT Work活跃用户达800万,重置使用限制并取消5小时速率限制,鼓励用户探索GPT-5.6 Sol的边界。
核心观点提炼常规快讯,保留列表
产品
精讲 12
产品OpenAI Blog当日精选64/100
正文内容概括OpenAI 发布 GPT-5.6 构建指南,教初创公司用新模型和 Responses API 构建更快更省的 AI 代理。
核心观点提炼常规快讯,保留列表
产品
精讲 13
产品MiniMax @MiniMax_AI当日精选62/100
正文内容概括MiniMax M3 在 Long-Horizon Terminal-Bench 上取得第7名,开源权重第1名,展示了其在长周期终端任务上的竞争力。
核心观点提炼常规快讯,保留列表
产品
精讲 14
技巧OpenAI Blog当日精选61/100
正文内容概括OpenAI 通过教程展示销售团队如何利用 ChatGPT Work 从实际工作输入中创建管道简报、会议准备包等文档,提升销售效率。
核心观点提炼常规快讯,保留列表
技巧
精讲 15
产品OpenAI Developers @OpenAIDevs当日精选62/100
正文内容概括JetBrains 将 OpenAI Codex 设为 AI 助手的推荐智能体,用户可随时切换,下月将重新评估。
核心观点提炼常规快讯,保留列表
产品
精讲 16
产品MiniMax @MiniMax_AI当日精选62/100
正文内容概括SambaNovaAI 在 RAISE 会议上展示了其 SN50 系统与 H200 搭配,在 MiniMax M2.7 模型上实现短上下文 850 t/s、长上下文 450+ t/s 的推理速度。
核心观点提炼常规快讯,保留列表
产品
精讲 17
技巧AYi @AYi_AInotes当日精选51/100
正文内容概括博主分享用AI复刻3D落日飞车游戏的秘诀:先签合同约束AI,分三轮迭代并逐条验收,最终生成单文件HTML游戏。
核心观点提炼常规快讯,保留列表
技巧
精讲 18
产品jason@jxnlco @jxnlco当日精选60/100
正文内容概括Codex 现在支持通过命令面板直接访问 Claude Code/Cowork 导入工具,简化了配置迁移流程。
核心观点提炼常规快讯,保留列表
产品
精讲 19
产品Cursor @cursor_ai当日精选65/100
正文内容概括Cursor 发布了 Grok Bot 早期测试版,这是一个 AI 队友,能够登录你的各种工具,像你一样使用它们,并返回已完成的工作成果。
核心观点提炼常规快讯,保留列表
产品
精讲 20
产品智谱AI @Zai_org当日精选65/100
正文内容概括ZCode 宣布用户数突破 100 万,为 GLM Coding Plan 用户重置使用限制,并推出更新提升工程工作流智能与缓存命中率。
核心观点提炼常规快讯,保留列表
产品
精讲 21
产品jason@jxnlco @jxnlco当日精选67/100
正文内容概括ChatGPT桌面应用是OpenAI推出的AI助手原生客户端,此前仅支持Windows和macOS,Linux用户无法在桌面环境直接使用。OpenAI发布了Linux版预览,使Linux用户能在支持的系统上使用ChatGPT、ChatGPT Work和Codex,与本地项目和浏览器工作流集成。这一更新填补了平台空白,让Linux开发者能够更便捷地利用AI进行对话、代码生成和团队协作,无需切换至网页版,从而提升工作效率和开发体验。该预览版标志着ChatGPT桌面应用向跨平台迈出重要一步。
核心观点提炼高信息密度,值得细读
产品Linux桌面应用预览ChatGPTCodex
精讲 22
产品Tibo Sottiaux @thsottiaux当日精选64/100
正文内容概括OpenAI 发布了 Codex 和 ChatGPT Work 的导入功能,允许开发者同步来自其他代理的项目、聊天、技能和插件。
核心观点提炼常规快讯,保留列表
产品
精讲 23
产品宝玉 @dotey当日精选63/100
正文内容概括Codex/Claude Code 现在支持跨 session 访问会话,开发者可将 Session Id 传递给其他 Agent 以共享上下文,避免手动总结损失信息。
核心观点提炼常规快讯,保留列表
产品
精讲 24
产品OpenRouter @OpenRouter当日精选63/100
正文内容概括OpenRouter 在 MCP 上发布了任务类型洞察功能,展示各任务下用户实际使用的模型,帮助开发者更精准选型。
核心观点提炼常规快讯,保留列表
产品
精讲 25
产品OpenAI Blog当日精选68/100
正文内容概括OpenAI 联合 AWS 在 Amazon Bedrock 上发布 Daybreak 网络安全模型,为企业提供 AI 驱动的安全防护能力。
核心观点提炼常规快讯,保留列表
产品
精讲 26
产品Meng Shao @shao__meng当日精选64/100
正文内容概括webAI Intelligence Lab 开源了形式化推理模型 TwiL-LM3,仅3B参数在4项基准测试中超越OpenAI的120B模型,推理速度快2.6倍。
核心观点提炼常规快讯,保留列表
产品
精讲 27
技术Meng Shao @shao__meng当日精选67/100
正文内容概括千问团队开源了Qwen-MM-Plugins多模态插件集,以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架,使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦,提供七大能力模块,包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成,降低了多模态智能体的开发门槛。
核心观点:
1. 项目采用Skill+MCP双层解耦,Skill是模型侧提示词资产,MCP server是工具本体,进程隔离依赖隔离。
2. 长视频记忆模块支持2小时级超长视频问答,首次提问自动构建层次化图记忆与语义检索。
3. 提供七大能力模块,覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等,可灵活组合。
核心观点提炼高信息密度,值得细读
技术多模态MCP智能体视觉理解视频理解
精讲 28
产品Peter Steinberger @steipete当日精选66/100
正文内容概括Anthropic 宣布新 Claude 模型将在所有生成文本中嵌入不可见水印,水印随文本复制粘贴而传播,可追溯来源。
核心观点提炼常规快讯,保留列表
产品
精讲 29
产品宝玉 @dotey当日精选64/100
正文内容概括Anthropic 宣布为 Claude 输出添加文本水印和 C2PA 数字签名元数据,成为首个在文本层面部署水印的 AI 大模型厂商,全球生效。
核心观点提炼常规快讯,保留列表
产品
精讲 30
技术宝玉 @dotey当日精选73/100
正文内容概括黎曼猜想是数学界最著名的未解难题之一,其零点比例问题在过去80年进展缓慢,2020年仅达41.7%。Anthropic的Claude模型通过协调约60个子智能体,运行2400条命令,将零点比例提升至67.2%,创下该问题历史上最大单步提升。Claude还使用Lean形式化证明语言写出可机器验证的证明。这一成果展示了AI在原创数学研究上的能力,对开发者意味着AI可辅助甚至主导前沿数学探索。
核心观点:
1. Claude将零点比例从41.7%提升至67.2%,单步提升26个百分点,超越过去50年进展。
2. Claude协调约60个子智能体,运行2400条命令,写数百Python脚本,实现分工协作。
3. Claude用Lean形式化证明语言写出可机器验证的证明,增强结果可信度。
核心观点提炼重磅首发或硬核洞察
技术黎曼猜想零点比例数学证明AI智能体形式化验证