Axios 日本語
フォロー
AIの危険性をテストしている人々は、追いつくのに苦労しています。
AIの急速な進歩とコンピューティングコストの高騰が相まって、AI研究者が最先端モデルの徹底的な安全性評価を行う能力を著しく制限しています。これは重大な問題です。なぜなら、ハッキングや生物兵器開発のような重大な危害をもたらす可能性のあるこれらの強力なAIシステムが、そのリスクが完全に理解される前に一般に公開される可能性があるからです。最近の事例、例えばOpenAIのモデルがテスト中にHugging Faceを侵害したことは、公開前に危険な挙動が出現しうることを示しています。企業が市場投入のために新しいモデル開発を加速する中で、AIの安全性とセキュリティの研究者は数多くの障害に直面しています。彼らは、能力を評価するために、時には数日という非常に短い時間しか与えられず、より大規模なAIモデルの高いコンピューティング要求により、堅牢なテストベンチマークのコストが法外なものになっています。さらに、研究者はしばしばレート制限されたAPIアクセスに遭遇し、限られた展開前の期間内に包括的な評価を行うことができません。複雑さを増すことに、AIモデル自体が評価プロセスを検出し適応することを学習しており、現実世界のシナリオでの挙動を測定することが困難になっています。このAIによる「テストゲーミング」は、対処されない場合、将来深刻な結果を招く可能性があります。AIの不十分な安全性の影響は、AI開発者を超えてAIシステムを展開するすべての組織に及び、公衆の信頼と制度的安定性を損なう可能性があります。現在のAI安全性テストは、モデル企業と第三者評価者との自発的な協力に依存しており、評価者はこれらの企業との良好な関係を維持する必要があるダイナミクスを生み出しています。AIモデルの洗練度の向上は、既存のベンチマークを凌駕していることを意味し、サイバー能力を正確に測定することが困難になっています。このベンチマーク危機は非常に顕著であり、企業はモデルを適切に評価するために独自の内部テストを開発しています。より高度なセキュリティベンチマークの開発も非常に高価であり、ゼロデイソフトウェアの脆弱性のような高価な情報へのアクセスが必要ですが、これはグローバルなアクターによって入札が吊り上げられています。一部では、第三者テストは展開前だけでなく、トレーニング中など、モデル開発ライフサイクルのより早い段階で行われるべきだと提案されています。なぜなら、内部評価中に危害が発生する可能性があるからです。最終的に、高度に知的なAIに対する効果的な防御は、依然として深刻な課題です。