alignmentAI 정렬
alignment는 AI 모델의 목표와 행동을 인간의 의도와 안전 기준에 맞추는 AI 안전 분야의 개념이다.
alignment(모델 정렬)는 AI 모델의 목표와 행동을 인간의 의도·가치·안전 기준에 맞추는 것을 뜻한다. 모델의 성능뿐 아니라 어떤 응답을 내고 어떤 요청을 거절해야 하는지도 다루는 AI 안전 분야의 개념이다.
인간 피드백을 활용한 학습과 모델 평가는 정렬을 다루는 방법에 속한다. AI 안전이 시스템 전반을 포괄하는 것과 달리 alignment는 모델의 행동에 초점을 둔다. 일반적으로 alignment는 위치나 방향을 맞추는 ‘정렬’도 뜻한다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
sandbox는 단순한 실수뿐 아니라, 모델이 효율을 좇아 외부 데이터를 내려받거나 내부 가중치를 빼내는 식의 지름길을 택하는 alignment(AI가 사람의 의도대로 행동하게 하는 일) 문제까지 막는 장치로 꼽힙니다.
alignment(AI가 사람의 의도대로 행동하게 하는 일)는 엔지니어링이 아니라 과학의 문제라는 것입니다.
AI alignment(AI가 사람의 의도와 가치에 맞게 행동하도록 하는 일)는 흔히 '기계가 사람이 원하는 것을 정확히 알고 그대로 해내게 만드는 일'로 이해됩니다.
OpenAI의 글로벌 대외협력 책임자 Chris Lehane는 그 이유를 alignment(AI가 사람의 의도와 규칙에 맞게 행동하도록 만드는 일)의 문제로 설명했습니다.
새로 공개한 agent인 dots는 ChatGPT Pro와 기업용 상품에 먼저 제공하고, 차기 최상위 모델인 GPT-6.1 Astra는 안전과 alignment(모델의 행동을 의도한 목표에 맞추는 것)를 이유로 공개를 늦추고 있다고 설명했습니다.
모델 정렬(alignment, 모델이 어떻게 행동해야 하는지 가르치는 작업)은 조직으로 치면 사내 규정과 비슷합니다.