从零开始构建自己的 LLM 运行时 笔记

从零开始构建自己的 LLM 运行时

如果你曾想过亲手构建一个 LLM 推理运行时——自行打包权重、掌控每一道屏障、捕获自定义的 CUDA 图——那么这就是在 H100 上这段旅程的模样。本文将以循序渐进的方式,介绍一个名为 annotated-llm-runtime 的小型运行时,并阐述其中三个引发绝大多数标注的 bug。