Towards Data Science | Medium 中文 关注 从零开始构建自己的 LLM 运行时 如果你曾想过亲手构建一个 LLM 推理运行时——自行打包权重、掌控每一道屏障、捕获自定义的 CUDA 图——那么这就是在 H100 上这段旅程的模样。本文将以循序渐进的方式,介绍一个名为 annotated-llm-runtime 的小型运行时,并阐述其中三个引发绝大多数标注的 bug。 How To Build Your Own LLM Runtime From Scratch towardsdatascience.com AI and ML News on Bluesky @ai-news.at.thenote.app bsky.app