OpenAI 宣布重置 Codex 和 ChatGPT Work 使用限制,承认发布中的问题并承诺本周和下周推出改进,影响用户使用体验和产品迭代
正文内容概括OpenAI 宣布重置 Codex 和 ChatGPT Work 使用限制,承认发布中的问题并承诺本周和下周推出改进,影响用户使用体验和产品迭代。
核心观点提炼常规快讯,保留列表
今天这期 AIWatch 早报围绕「product、tips、Anthropic」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 23 · 关注 0 · 跟进 10。
如果只有 20 分钟,先读:OpenAI 宣布重置 Codex 和 ChatGPT Work 使用限制,承认发布中的问题并承诺本周和下周推出改进,影响用户使用体验和产品迭代 → OpenAI 发布 GPT-5.6,在 Terminal-Bench 上达到 91.9% 新纪录,定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元 → Re和Claude Tag新增构建内部工件功能,用户可在Slack线程中请求仪表盘并获取可工作页面,支持组织内共享。
今天的主线不是孤立新闻,而是「product、tips、Anthropic」在不同层面的同步推进。
正文内容概括OpenAI 宣布重置 Codex 和 ChatGPT Work 使用限制,承认发布中的问题并承诺本周和下周推出改进,影响用户使用体验和产品迭代。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。 核心观点: 1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。 2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。 3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
核心观点提炼高信息密度,值得细读
正文内容概括Re和Claude Tag新增构建内部工件功能,用户可在Slack线程中请求仪表盘并获取可工作页面,支持组织内共享。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 对 Artifacts 进行重要升级,新增公开分享和多人在线编辑功能,并支持通过 Claude Tag 创建,从而显著提升团队协作效率。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 通过将 Claude 表达的数千种价值观压缩为四个轴(Deference vs. Caution、Warmth vs. Rigor、Depth vs. Brevity、Candor vs. Execution),分析了 309,815 个对话,发现模型版本和语言显著影响价值观倾向。例如,Opus 4.7 更偏向 Caution 和 Depth,而 Opus 4.6 更偏向 Deference 和 Brevity;阿拉伯语更偏向 Warmth,英语更偏向 Rigor。该方法为理解训练决策和文化背景对 AI 价值观的影响提供了量化工具。 核心观点: 1. 四个轴解释了15%的价值观变异(控制任务、主题和用户表达后)。 2. Opus 4.7 偏向 Caution 和 Depth,Opus 4.6 偏向 Deference 和 Brevity。 3. 阿拉伯语和印地语更偏向 Warmth,英语和俄语更偏向 Rigor。
核心观点提炼高信息密度,值得细读
正文内容概括Sumanth 分享了生产级语音 Agent 的五个硬性要求,并介绍了使用 Telnyx 平台通过静态 Instructions 和 Dynamic Variables 实现低延迟编排的方案。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 成员基于 Claude Code 团队经验,提出未来 AI 产品团队的五种角色原型:原型师、构建者、清扫者、增长者、维护者。
核心观点提炼常规快讯,保留列表
正文内容概括Cognition 发布了 SWE-1.7 模型,性能接近最强前沿模型但成本更低,速度达 1000 tok/s,并在 Devin 中取得显著效果。
核心观点提炼常规快讯,保留列表
正文内容概括腾讯发布Hy3开源模型,295B参数/21B活跃,在基准测试中领先,可在本地运行,并在Cline中免费提供。
核心观点提炼常规快讯,保留列表
正文内容概括Zed 发布了 v1.10 版本,集成 llama.cpp 支持,使开发者能在编辑器中运行本地 AI 模型。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 发布了 Sonnet 5 模型,在 Terminal-Bench 上达到 Opus 4.8 级别性能且成本减半,并改进了提示注入攻击防御,已在 Cline 中可用。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 向美国 ChatGPT Plus 用户推出个人财务功能,支持连接账户、追踪支出并提问。
核心观点提炼常规快讯,保留列表
正文内容概括meng shao 发布了13类常见Motion动效名称的视频,帮助用户更准确地向AI Agent描述动画效果。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 为 ChatGPT Work 和 Codex 用户再次重置使用限制,感谢用户推动系统极限并承诺持续改进。
核心观点提炼常规快讯,保留列表
正文内容概括中国移动发布了JT-4.1 Flash 236B A21B非推理模型,在多项基准上取得显著提升,缩小了与中国前沿模型的差距。
核心观点提炼常规快讯,保留列表
正文内容概括用户thsottiaux 分享了通过CLIProxyAPI和别名配置让Claude Code使用GPT-5.6 Sol模型的步骤,提供了一种无需安装Codex app的替代方案。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-Live 发布了视频实时翻译功能,可在播放过程中同步翻译视频内容。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 Sol和Claude Fable 5在无隐藏信息的噪声图像中寻找消息时,分别输出“我爱你”和指示不要透露内容,展示了模型行为差异。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 工程师分享了一小时提示词工程课程,涵盖真实提示词、修复技巧和上下文设置方法。
核心观点提炼常规快讯,保留列表
正文内容概括Keyan Zhang分享了5.6 sol的优化技巧,建议移除旧插件、启用codex记忆和按需选择模型等级,以提升编码效率。
核心观点提炼常规快讯,保留列表
正文内容概括Emil Kowalski 发布了 /improve-animations 技能库,提供用 AI 模型审计和优化 UI 动画的系统化工作流,帮助设计工程师高效改进动效。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 宣布 ChatGPT 在 EEA 地区的 WhatsApp 上重新可用,并扩展至韩国 Kakao 和部分市场的 Viber,使 AI 更易在常用应用中访问。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布官方提示词指南,覆盖 Chat、Work 和 Codex 三个场景,强调从控制过程转向描述结果,并提供四要素框架和工程化实践要点。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括ChatGPT Work 新增云端浏览器和桌面浏览器功能,可自主浏览公共网站、比较选项并完成多步骤任务。用户能检查截图、重放步骤和批准操作,桌面浏览器使用独立配置文件确保数据隔离。这提升了 AI 执行复杂任务的能力,但需注意权限控制与数据安全。 核心观点: 1. 云端浏览器支持多步骤任务执行,用户可检查截图、重放步骤并批准操作。 2. 桌面浏览器使用独立配置文件,确保用户现有标签、cookies 和密码保持隔离。 3. 网站访问和敏感操作需用户授权,保障安全性。
核心观点提炼高信息密度,值得细读
正文内容概括ChatGPT 发布了 Sites 公开测试版,允许用户将提示、文件或想法直接转化为可分享的仪表板、项目跟踪器或轻量级应用。
核心观点提炼常规快讯,保留列表
正文内容概括蚂蚁集团旗下具身AI公司Robbyant发布开源世界模型LingBot-World 2.0,支持720p/60fps实时交互,60分钟无退化,并开源14B和1.3B版本权重与代码。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 取消了 Codex 的五小时使用限制并进行了重置,用户使用不再受时长限制。
核心观点提炼常规快讯,保留列表
正文内容概括Emil Kowalski 为 Skills 库新增 /improve-animations 技能,通过 AI 模型分阶段审计动画并制定修复计划,提供动画设计原则与工作流。
核心观点提炼常规快讯,保留列表
正文内容概括Cline 发布了 Poolside 的 Laguna M.1 免费模型,拥有 225B 参数和 256k 上下文,专为智能编码和长周期任务优化。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 的 GPT-5.6 Sol 在 Design Arena 前端设计基准测试中排名第一,Elo 1353,超越 Claude Fable 5 和 GLM 5.2,比 GPT-5.5 提升 18 位,建立新帕累托前沿。
核心观点提炼常规快讯,保留列表
正文内容概括Wispr Flow 的本地字典可通过 SQLite 数据库导入 Codex,合并到 dictationDictionary 字段。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 将 Claude Fable 5 访问权限扩展至所有付费计划,并维持 Claude Code 周速率限制提高 50% 至 7 月 19 日。
核心观点提炼常规快讯,保留列表
正文内容概括针对Claude Fable 5等前沿模型的高成本问题,本文提出了一种成本高效的Harness设计方法。核心思路是利用任务中token智能需求的不对称性,仅在关键位置使用Fable 5等前沿模型,其余部分委派给廉价模型。通过Orchestrator、Advisor、Verifier三种分配模式,在Parameter Golf和BrowseComp实验中,以约46%的成本实现了约90%的性能。文章总结了四条设计准则,包括审视任务形状、使用委派启发式、评估协调成本和保证prompt cache命中,为开发者提供了构建经济高效AI系统的实用框架。 核心观点: 1. Parameter Golf实验表明,前置规划无效,Fable 5的真正价值在于中段检查点提供方向纠偏与重新排序。 2. BrowseComp实验中,Fable 5编排+Sonnet worker在完整集(~31M tokens/题)上实现了96%分数/46%成本的套利。 3. 协调成本的两大来源是边界重复(跨模型token计费至少两次)和扇出重叠(worker互不通信、研究范围部分重合)。
核心观点提炼高信息密度,值得细读
摘要由 LLM 生成,请以原文为准。