DZone.com Feed 日本語
フォロー
アラートの洪水に溺れることなくAIモデルを監視する方法
モデルを本番環境にデプロイする際、どのチームや組織も同じ問題に直面します。当初は監視がないため、数日間、障害が見過ごされます。チームが問題の修正に取り掛かると、本番環境の結果がトレーニングデータから逸脱している領域を特定し、あらゆるメトリックのダッシュボードを作成し、あらゆるしきい値のアラートを設定します。これにより、エンジニアは1時間以内に自己解決するバグのために午前2時に呼び出され、重要なアラートが発生した際にはアラート疲労により応答されず、モデルにサイレントにゴミを供給するパイプラインが作成されます。チームが問題の95%を無視することを学ぶと、実際には重要な残りの5%も無視する可能性が非常に高くなります。これに対する解決策は、監視を減らすことではありません。この問題に対する良い解決策は、ほとんどのチームがすでに知っているインフラストラクチャ監視とは異なる、階層化され、ルーティングされ、枝刈りされた監視です。