LLM-as-a-judgeLLM 평가자

대규모 언어 모델에게 정해진 기준으로 다른 AI의 출력을 채점하게 하는 평가 방법이다.

기사 1편
최근 언급

LLM-as-a-judge는 대규모 언어 모델을 평가자로 써서 다른 모델이나 AI 애플리케이션의 응답을 채점하는 방법이다. 평가 모델은 정해진 기준에 따라 점수나 통과·실패 같은 판정을 내리고, 판정 이유를 자연어로 설명하기도 한다.

사람이 하나씩 검토하기 어려운 많은 양의 출력을 자동으로 평가하는 데 쓰이며, 정답이 하나로 정해지지 않는 답변의 정확성, 충실성, 안전성 같은 품질을 판단하는 데 활용된다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

2025년에 널리 쓰인 해법은 LLM-as-a-judge, 곧 언어 모델이 정해진 기준에 따라 trace를 채점하게 하는 eval(평가)이었습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.