Claude Code 桌面版新增内置浏览器,使 Claude 能像操作本地服务器一样浏览和点击网页,方便开发者查阅文档和设计
正文内容概括Claude Code 桌面版新增内置浏览器,使 Claude 能像操作本地服务器一样浏览和点击网页,方便开发者查阅文档和设计。
核心观点提炼常规快讯,保留列表
今天这期 AIWatch 早报围绕「product、Claude、tips」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 15 · 关注 1 · 跟进 10。
如果只有 20 分钟,先读:Claude Code 桌面版新增内置浏览器,使 Claude 能像操作本地服务器一样浏览和点击网页,方便开发者查阅文档和设计 → OpenAI 重置了 ChatGPT Work 和 Codex 的使用限制,承认了发布中的问题并宣布了今日和下周的改进,以提升用户体验 → Claude Code 桌面版新增内置浏览器,可打开并交互任意网站,包括生产应用、文档和社交媒体,扩展了 AI 的网页访问与操作能力。
今天的主线不是孤立新闻,而是「product、Claude、tips」在不同层面的同步推进。
正文内容概括Claude Code 桌面版新增内置浏览器,使 Claude 能像操作本地服务器一样浏览和点击网页,方便开发者查阅文档和设计。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 重置了 ChatGPT Work 和 Codex 的使用限制,承认了发布中的问题并宣布了今日和下周的改进,以提升用户体验。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 桌面版新增内置浏览器,可打开并交互任意网站,包括生产应用、文档和社交媒体,扩展了 AI 的网页访问与操作能力。
核心观点提炼常规快讯,保留列表
正文内容概括宝玉分享了视频字幕处理工具从LLM方案转向Agent+Skill方案的经验,指出Agent纠错能力强、成本低,配合CLI和Skill可提升效率。
核心观点提炼常规快讯,保留列表
正文内容概括Meta 发布了 Muse Spark 1.1 多模态推理模型,用于智能体编程、工具使用和计算机操作工作流,已在 OpenClaw 平台上线。
核心观点提炼常规快讯,保留列表
正文内容概括SlopCodeBench 基准测试通过连续任务评估编码代理,发现代理代码比人类代码冗长2.3倍、退化速度快5-7倍。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT 发布了构建和发布完整 Web 应用的新功能,使开发者能通过对话直接创建和部署应用。
核心观点提炼常规快讯,保留列表
正文内容概括Mitchell Hashimoto 用 ChatGPT 自动化分析三年建筑发票,发现约 4.5 万美元错误账单,验证后获得退款,展示了 AI 在财务审计中的实际应用价值。
核心观点提炼常规快讯,保留列表
正文内容概括海辛和阿文总结了Seedance视频生成实用心得,指出提示词只需四部分并给出工作流建议,帮助用户提升效率。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT 更新 iOS 应用,新增 Codex 可视化功能,支持在移动端动态生成图表和自定义内容,提升数据交互体验。
核心观点提炼常规快讯,保留列表
正文内容概括DeepEval 发布 Google ADK 集成,通过一行代码自动追踪智能体运行,支持 Pytest 端到端与组件级评估。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 向加拿大三大 AI 研究所及多家机构投资 1000 万加元,提供 Claude 积分以推动 AI 研究与应用。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 经济指数报告显示加拿大在 Claude 采用率上领先,人均使用量是预期的四倍,且使用模式与当地经济特征相关。
核心观点提炼常规快讯,保留列表
正文内容概括Demis Hassabis 发文称 AGI 可能几年内实现,其影响将远超工业革命,并呼吁建立监管基础设施。
核心观点提炼常规快讯,保留列表
正文内容概括Muse Spark 1.1 在 AA-Briefcase 基准测试中取得 863 分,与 Gemini 3.5 Flash 持平,但演示质量得分下降。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 宣布 GPT-5.6 sol 模型相比 fable 价格减半、token 效率翻倍,并承诺以更低价格交付。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 宣布重置 Codex 和 ChatGPT Work 使用限制,承认发布中的问题并承诺本周和下周推出改进,影响用户使用体验和产品迭代。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。 核心观点: 1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。 2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。 3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
核心观点提炼高信息密度,值得细读
正文内容概括Re和Claude Tag新增构建内部工件功能,用户可在Slack线程中请求仪表盘并获取可工作页面,支持组织内共享。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 对 Artifacts 进行重要升级,新增公开分享和多人在线编辑功能,并支持通过 Claude Tag 创建,从而显著提升团队协作效率。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 通过将 Claude 表达的数千种价值观压缩为四个轴(Deference vs. Caution、Warmth vs. Rigor、Depth vs. Brevity、Candor vs. Execution),分析了 309,815 个对话,发现模型版本和语言显著影响价值观倾向。例如,Opus 4.7 更偏向 Caution 和 Depth,而 Opus 4.6 更偏向 Deference 和 Brevity;阿拉伯语更偏向 Warmth,英语更偏向 Rigor。该方法为理解训练决策和文化背景对 AI 价值观的影响提供了量化工具。 核心观点: 1. 四个轴解释了15%的价值观变异(控制任务、主题和用户表达后)。 2. Opus 4.7 偏向 Caution 和 Depth,Opus 4.6 偏向 Deference 和 Brevity。 3. 阿拉伯语和印地语更偏向 Warmth,英语和俄语更偏向 Rigor。
核心观点提炼高信息密度,值得细读
正文内容概括Sumanth 分享了生产级语音 Agent 的五个硬性要求,并介绍了使用 Telnyx 平台通过静态 Instructions 和 Dynamic Variables 实现低延迟编排的方案。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 成员基于 Claude Code 团队经验,提出未来 AI 产品团队的五种角色原型:原型师、构建者、清扫者、增长者、维护者。
核心观点提炼常规快讯,保留列表
正文内容概括Cognition 发布了 SWE-1.7 模型,性能接近最强前沿模型但成本更低,速度达 1000 tok/s,并在 Devin 中取得显著效果。
核心观点提炼常规快讯,保留列表
正文内容概括腾讯发布Hy3开源模型,295B参数/21B活跃,在基准测试中领先,可在本地运行,并在Cline中免费提供。
核心观点提炼常规快讯,保留列表
正文内容概括Zed 发布了 v1.10 版本,集成 llama.cpp 支持,使开发者能在编辑器中运行本地 AI 模型。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。