Topic Timeline
#基础设施
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 行业动态2026-08-01 · 周六重要度 4/5深度报告 →
OpenAI 新披露成本与使用数据,降价是前一日事件
OpenAI CFO Sarah Friar 发布全栈成本文章,披露端到端服务成本降低 20% 等数据。文中所称 Luna 与 Terra 降价发生在前一日,并非再次降价。
当天增量是公司把模型、推理基础设施和需求增长放进同一成本叙事。关键运营数字仍是厂商自报,缺少绝对成本基线。
- 产品上新2026-07-05 · 周日重要度 3/5
GitHub 738★:jamesob「本地运行 LLM 一切我所知」
jamesob 维护的 jamesob、local-llm 仓库 738★,系统整理本地运行 LLM 的硬件选型、模型量化、推理框架、显存调优,是当下最完整的本地 LLM 攻略。
- 738★ 的含金量不在具体参数,而在它代表本地 LLM 从极客玩具走向工程化参考资料的拐点。
- 开发者面对 frontier API 涨价、隐私合规、离线场景时,「本地能跑哪些模型」突然成为必备知识。
- 研究论文2026-07-01 · 周三重要度 4/5深度报告 →
OpenAI 用流行病学方法解剖 Rockset 的 18 年老 bug:不要做单 case 的医生,先建一个高质量的全人群数据集
OpenAI 工程团队没有按'医生'式思路逐 case 推断单一根因,而是先建了一个高质量的崩溃全人群数据集,把症状拆成两个独立问题:一台 Azure 物理机 CPU 硬件故障让 %rsp 错位,Glibc/libunwind 里的 _Ux86_64_setcontext 自 2008 年起就有的一个约 100 皮秒的竞态窗口又恰巧被高频 SIGUSR2 触发。缓解方案已经上线(GCC unwinder + 向上游提交 reproducer 与 fix),更值钱的是它示范了'为什么调试基础设施问题应该用流行病学,而不是看一例猜一因'。
- 这是一篇『系统工程师反思』式的工程故事,真正的价值不在 bug 本身而在方法论
- OpenAI 把 SIGUSR2 处理器加 timer_getoverrun 触发了原本隐蔽的 18 年 bug,而单 case 调试永远找不到这种『上层改一下就让底层崩』的根因。