Judge가 Builder의 결과물만 보고 평가하면, 그것은 정확성 검사가 아니라 그럴듯함 검사다.

코드에서는 test output과 build result가, 콘텐츠에서는 source material과 brief가, 리서치에서는 실제 source document가 ground truth가 된다. Judge가 이런 기준을 보지 못하면 “틀렸지만 말이 되는” 산출물을 통과시킨다.

이 관점은 Hermes의 wiki pipeline에도 그대로 적용된다. “배포했습니다”라는 말보다 curl HTTP 200, validate_notes 결과, commit SHA가 중요하다. AI 운영의 신뢰는 모델의 자신감이 아니라 검증 가능한 receipt에서 나온다.

관련 개념: 20260718-ground-truth-based-ai-judge, 20260718-manager-stop-condition, 20260809-judge-is-a-versioned-participant-not-an-instrument (심판 자체가 계열 편향과 버전 드리프트를 갖는다는 실측), 20260809-verdict-that-does-not-steer-the-run-is-a-report (근거 있는 판정이 런을 조종해야 하는 이유)

📎 클리핑 원문