精讲 1
产品Meng Shao @shao__meng本周精选67/100
正文内容概括代码产量增长导致审查瓶颈,隐性知识难以传递。OpenAI 发布 Codex Code Review 的 AGENTS.md 自定义规则功能,允许团队将 reviewer 的隐性知识写成规则,在审查时应用,使召回率从 58.3% 提升到 98%。开发者可编写规则捕获兼容性等难以发现的违规,提升审查效率,并获得了编写规则的方法论指导。
核心观点:
1. 带规则的审查召回率从 58.3% 提升到 98%,说明模型缺的是“该看什么”的上下文。
2. 评测围绕 Coverage、Restraint、Retention、Actionability 四个维度,其中 Restraint 和 Retention 最易被忽视。
3. 编写规则应从“有后果且不显眼”的不变量开始,作用域对齐代码,并给出安全替代方案。
核心观点提炼高信息密度,值得细读
产品代码审查自定义规则AGENTS.mdCodex Code Review召回率
精讲 2
技巧Meng Shao @shao__meng本周精选68/100
正文内容概括Claude Code团队在炉边对谈中分享系统提示词削减80%的经验。他们发现删除示例(few-shot examples)反而更好,因为当前模型比示例更有创造力;少用“不要做X”的禁令,多给上下文;检验每条指令是否100%成立,避免90%正确的指令导致误读。这些做法依赖Opus/Fable级别模型的判断力,对小模型仍需详细提示词。对开发者而言,提示词工程需从详细指令转向信任模型判断力,并重视评测。
核心观点:
1. 删除示例对Opus/Fable级模型更有效,模型比给定示例更有创造力。
2. 每条指令需检验是否100%成立,避免90%正确指令被误读。
3. 该方法依赖Opus/Fable级模型的判断力,小模型仍需详细提示词。
核心观点提炼高信息密度,值得细读
技巧系统提示词提示词工程Claude Code模型判断力评测
精讲 3
产品月之暗面 @Kimi_Moonshot当日精选67/100
正文内容概括Kimi K3在AA-Briefcase基准测试中取得第二高分(Elo 1543),但每任务成本高达10.57美元,是前代Kimi K2.6的10倍。
核心观点提炼常规快讯,保留列表
产品
精讲 4
产品宝玉 @dotey当日精选54/100
正文内容概括知识猫图解 开源了故事转手绘视频 Skill,可将中文故事自动生成手绘日记动画,支持分镜、手写字幕和上色效果。
核心观点提炼常规快讯,保留列表
产品
精讲 5
技术Sakana AI @SakanaAILabs当日精选66/100
正文内容概括推理时扩展是提升LLM性能的重要方法,但掩码扩散语言模型(MDLM)通过随机性生成多样答案效果不佳。Sakana AI Labs提出UnMaskFork,通过多个MDLM协作和蒙特卡洛树搜索实现推理时扩展,在编码和数学任务上超越现有方法。该方法无需额外训练,可直接组合预训练模型提升性能,为MDLM的推理时扩展提供新方向。
核心观点:
1. UnMaskFork使用模型切换而非温度随机性产生多样性,通过MCTS探索最优协作顺序。
2. 在编码基准上一致优于现有推理时扩展方法,数学任务上随计算量稳步提升。
核心观点提炼高信息密度,值得细读
技术推理时扩展掩码扩散语言模型蒙特卡洛树搜索模型协作编码任务
精讲 6
产品Fireworks AI @FireworksAI_HQ当日精选65/100
正文内容概括Fireworks AI 宣布支持在平台上训练 MiniMax M3 模型,提供托管 LoRA SFT/DPO 和自定义训练 API。
核心观点提炼常规快讯,保留列表
产品
精讲 7
技术Meng Shao @shao__meng当日精选67/100
正文内容概括Cursor团队通过从零实现SQLite的实验,验证了Agent Swarm中上下文分工和模型组合的经济性。新harness显著优于旧:Grok 4.5新系统4小时达80%,旧系统不到2小时失控。架构为树形:强模型Planner拆分决策,便宜模型Worker执行。可扩展性来自上下文效率而非并行,协调成本是瓶颈。模型组合质量接近时成本差一个数量级($1,339 vs $20,057),优化策略是frontier仅用于高熵决策。实验还揭示了五类失败模式。对开发者:Harness设计、上下文分工和成本优化是关键。
核心观点:
1. 新harness在所有模型配置下更好,Grok 4.5新系统4小时约80%,旧系统不到2小时失控。
2. 不同模型mix质量接近,费用差极大:Opus planner+Composer worker成本$1,339,全程Fable $20,057。
3. 可扩展性主要来自上下文效率,planner不写实现、worker不规划,各自专注上下文。
核心观点提炼高信息密度,值得细读
技术Agent SwarmSQLiteRust上下文分工协调成本
精讲 8
产品ChatGPTapp @ChatGPTapp当日精选64/100
正文内容概括ChatGPT 写作功能新增在写作前询问几个问题以理解上下文,减少来回沟通,生成更个性化草稿,提升写作效果。
核心观点提炼常规快讯,保留列表
产品
精讲 9
产品OpenRouter @OpenRouter当日精选64/100
正文内容概括Thinking Machines 的 Inkling 模型在 OpenRouter 上线,拥有 975B 总参数、41B 活跃参数、1M 上下文及多模态可控推理能力。
核心观点提炼常规快讯,保留列表
产品
精讲 10
产品Chubby @kimmonismus当日精选64/100
正文内容概括Thesean 发布了 Ship 端点,通过在模型名前加前缀实现固定 50% 成本降低,同时保持能力与行为,并公开 SLO 衡量质量。
核心观点提炼常规快讯,保留列表
产品
精讲 11
产品月之暗面 @Kimi_Moonshot当日精选64/100
正文内容概括Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo。
核心观点提炼常规快讯,保留列表
产品
精讲 12
产品NVIDIA AI @NVIDIAAI当日精选65/100
正文内容概括NVIDIA 发布 Nemotron 3 Ultra 模型,在 2026 年国际数学奥林匹克竞赛中取得 30/42 分,超过金牌线。
核心观点提炼常规快讯,保留列表
产品
精讲 13
产品NVIDIA AI @NVIDIAAI当日精选64/100
正文内容概括NVIDIA Brev 平台现已支持 Devin Outposts,开发者可编写和分析内核、运行实验、提供和微调开源模型,并在真实硬件上测试。
核心观点提炼常规快讯,保留列表
产品
精讲 14
产品Sourcegraph Amp @AmpCode当日精选64/100
正文内容概括Amp 发布了代理计划与自我唤醒功能,允许代理设置时间表并自动启动,实现无人值守运行。
核心观点提炼常规快讯,保留列表
产品
精讲 15
产品jason@jxnlco @jxnlco当日精选63/100
正文内容概括OpenAI 将 Codex 合并到 ChatGPT,推出 GPT 5.6 系列模型(Sol、Terra、Luna),使 ChatGPT 成为知识工作的 AI 超级应用,并附带推荐设置和提示指南。
核心观点提炼常规快讯,保留列表
产品
精讲 16
产品OpenRouter @OpenRouter当日精选63/100
正文内容概括OpenRouter 上线了 SpaceXAI 的 Grok Imagine Video 1.5 模型,支持将静态图像通过文本提示生成带音效和对话的动态视频。
核心观点提炼常规快讯,保留列表
产品
精讲 17
技巧Philipp Schmid @_philschmid当日精选62/100
正文内容概括Gemini Managed Agents 通过拦截 GitHub API 调用并交换令牌,实现安全的自动化 PR triage,agent 获得完整 CLI 访问而令牌保留在控制平面。
核心观点提炼常规快讯,保留列表
技巧