SIMD(单指令多数据)常被认为复杂,但Mitchell Hashimoto通过Zig示例展示了其通用编程模式。文章以Ghostty终端中扫描控制字符为例,演示了五步法:广播常量、按向量宽度循环、并行比较、归约结果、标量尾部处理。该模式在ARM上实现4倍加速,Intel AVX2上8倍,AVX-512上16倍。作者强调编译器自动向量化有限,手动SIMD可预测且高效,鼓励开发者掌握这一技能。 核心观点: 1. SIMD通用模式包含5步:广播常量、按向量宽度循环、并行操作、归约结果、标量尾部处理。 2. 在Ghostty实际应用中,SIMD版本在AVX2上实现约5倍端到端加速。 3. 编译器自动向量化能力有限,手动SIMD可确保显式且可预测的优化。
OpenAI 与 Broadcom 联合推出专为大语言模型推理优化的定制芯片 Jalapeño,旨在提升 AI 系统的性能、效率和可扩展性。该芯片针对 LLM 推理场景进行专门设计,有望降低推理成本并提高响应速度,对开发者和研究者而言,意味着未来可能获得更高效、更低成本的 AI 推理基础设施。
Amp 上月重构架构,其 deep 与 rush 模式(GPT-5.5)通过 durable execution 与长连接 OpenAI WebSocket 削减用户与 GPU 间的通信跳转,在 durable execution 中运行 agent loops 以充分利用长连接优势,任务完成速度最高提升 40%,为开发者提供更高效的 AI 智能体响应体验。 核心观点: 1. Amp 上月重构架构,通过削减用户与 GPU 间跳转并在 durable execution 中运行 agent loops,以最大化利用长连接 OpenAI WebSocket。 2. 重构后的 deep 与 rush 模式(GPT-5.5)将任务完成速度最高提升 40%。