DZone.com Feed 日本語
フォロー
コンテナ化されたLLM:DockerベースのAIワークロードのためのベストプラクティス
クライアントの社内検索ツール用にファインチューニングされたLlamaモデルを初めてコンテナ化したとき、ビルドは38ギガバイトで完了しました。ターミナルを見つめながら、そんなはずはないと思っていました。しかし、それは正しかったのです。イメージには、CUDAベース、すべてのバックエンドがコンパイルされたPyTorch、レイヤーに直接焼き込まれたモデルの重み、そしてクリーンアップされていないpipキャッシュが含まれていました。それをレジストリにプッシュするには、良好な接続でも11分かかりました。オートスケールイベント中に新しいノードにプルするにはさらに時間がかかり、ポッドが準備できた頃には、処理するはずだったトラフィックのスパイクはすでに過ぎていました。その瞬間、私はLLMコンテナを通常のアプリケーションコンテナとして扱うのをやめました。なぜなら、それらは全く異なるものだからです。