MachineLearningMastery.com 日本語 フォロー Transformer推論のパフォーマンス測定 この章は8つのパートに分かれています。以下の通りです。 • LLM推論のメトリクス • 単一のリクエストの測定 • ウォームアップと同期 • CUDAイベントを使用したGPUワークの測定 • メモリ使用量の測定 • 並行リクエストの測定 • 複数のGPUと複数のマシン • トークンあたりのコスト 最も一般的な推論メトリクスは以下の通りです。 • レイテンシ:リクエストが開始されてから完了するまでにかかる時間 Measuring Performance of Transformer Inference machinelearningmastery.com MachineLearningMastery.com 日本語 RSS thenote.app