Meta声称Muse Spark 1.2与Muse agent harness共同训练,Cline团队从中提取系统提示指令应用到自身harness。在修复真实bug任务中,修改后的harness相比原始版本token减少2.7倍(19.7M→7.2M),速度提升2倍(49min→24min),成本降低2.4倍($7.69→$3.25)。这表明系统提示对agent性能影响巨大,提示工程可带来显著提升。 核心观点: 1. 提取指令强调信任源代码、重视边缘案例、修复前重现bug、持续验证完成。 2. 相同模型Muse Spark 1.2下,仅改变提示使token减少2.7倍、速度提升2倍、成本降低2.4倍。
SIMD(单指令多数据)常被认为复杂,但Mitchell Hashimoto通过Zig示例展示了其通用编程模式。文章以Ghostty终端中扫描控制字符为例,演示了五步法:广播常量、按向量宽度循环、并行比较、归约结果、标量尾部处理。该模式在ARM上实现4倍加速,Intel AVX2上8倍,AVX-512上16倍。作者强调编译器自动向量化有限,手动SIMD可预测且高效,鼓励开发者掌握这一技能。 核心观点: 1. SIMD通用模式包含5步:广播常量、按向量宽度循环、并行操作、归约结果、标量尾部处理。 2. 在Ghostty实际应用中,SIMD版本在AVX2上实现约5倍端到端加速。 3. 编译器自动向量化能力有限,手动SIMD可确保显式且可预测的优化。
OpenAI 与 Broadcom 联合推出专为大语言模型推理优化的定制芯片 Jalapeño,旨在提升 AI 系统的性能、效率和可扩展性。该芯片针对 LLM 推理场景进行专门设计,有望降低推理成本并提高响应速度,对开发者和研究者而言,意味着未来可能获得更高效、更低成本的 AI 推理基础设施。
Amp 上月重构架构,其 deep 与 rush 模式(GPT-5.5)通过 durable execution 与长连接 OpenAI WebSocket 削减用户与 GPU 间的通信跳转,在 durable execution 中运行 agent loops 以充分利用长连接优势,任务完成速度最高提升 40%,为开发者提供更高效的 AI 智能体响应体验。 核心观点: 1. Amp 上月重构架构,通过削减用户与 GPU 间跳转并在 durable execution 中运行 agent loops,以最大化利用长连接 OpenAI WebSocket。 2. 重构后的 deep 与 rush 模式(GPT-5.5)将任务完成速度最高提升 40%。