AI 인프라 에이전트를 실제로 더 신뢰할 수 있게 만드... 노트

AI 인프라 에이전트를 실제로 더 신뢰할 수 있게 만드는 것 (더 많은 에이전트가 아닙니다)

"저는 계속해서 같은 패턴을 봅니다. 누군가가 인프라 모니터링을 위한 "AI 에이전트"를 구축합니다. 이 에이전트는 Prometheus 메트릭에 대한 질문에 답하고, ELK에서 로그를 가져오고, 재시작을 제안합니다. 데모에서는 인상적입니다. 그런 다음 이를 밀어붙이면 다음과 같은 질문이 생깁니다. 조사 중에 로그 쿼리가 시간 초과되면 어떻게 됩니까? 네 개의 시스템에 걸쳐 신호를 상관시키는 동안 컨텍스트 창이 꽉 차면 어떻게 됩니까? 존재하지 않는 메트릭 이름을 약간 잘못 환각하는 도구 호출이 발생하면 어떻게 됩니까?보통은 치명적으로 실패하지 않습니다. 디버깅하기 어려운 방식으로 조용히 실패합니다. 그리고 사고 대응 중의 조용한 실패는 최악의 종류입니다."