정의
Ground-truth-based AI Judge는 AI 산출물을 모델의 느낌이나 내부 일관성이 아니라 외부 기준에 비추어 평가하는 검증 역할이다.
왜 중요한가
글의 핵심 경고는 Judge가 Builder output만 보면 correctness를 검증할 수 없다는 점이다. 이런 Judge는 산출물이 그럴듯하고 형식적으로 일관적인지만 볼 수 있으며, 실제 요청을 해결했는지·사실과 맞는지·테스트를 통과했는지는 확인하지 못한다.
Ground truth 예시
- 코드: test suite, 실제 실행 결과, lint result, build status
- 콘텐츠: 원문 source material, original brief, required sections
- 리서치: search results, source documents, claim-to-source trace
실패 모드
- 같은 모델, 같은 context에서 “다시 확인해”라고 묻는 self-review는 Builder의 blind spot을 공유한다.
- Judge가 source 없이 draft만 보면 “정확한가”가 아니라 “그럴듯한가”를 평가한다.
- Judge verdict가 free-form prose면 Manager가 안정적으로 routing하기 어렵다.
연결
- 20260718-self-correcting-ai-loop-architecture — Builder-Judge-Manager 구조
- 20260718-manager-stop-condition — Judge 실패가 반복될 때 loop를 중단하는 조건