PreferenceLearning2 RLHF란? 사람의 피드백은 AI 답변을 어떻게 바꿀까? ChatGPT 같은 대규모 언어 모델은 방대한 텍스트를 학습해 자연스러운 문장을 만들 수 있습니다.하지만 문장을 자연스럽게 만드는 능력과 사람에게 도움이 되는 답변을 만드는 능력은 완전히 같은 것은 아닙니다.예를 들어 같은 질문에 대해 두 답변 모두 문법적으로 자연스럽더라도 하나는 질문의 핵심을 정확하게 설명하고, 다른 하나는 관련 없는 내용을 길게 늘어놓을 수 있습니다.그렇다면 AI는 어떤 답변을 사람이 더 선호하는지 어떻게 배울 수 있을까요?이때 등장하는 대표적인 방법이 RLHF(Reinforcement Learning from Human Feedback)입니다.RLHF는 사람이 모델의 여러 답변을 비교하고 평가한 정보를 학습에 활용해 모델이 사람이 선호하는 방향의 답변을 더 많이 생성하도록 조정하는.. 2026. 9. 28. AI 정렬이란? 언어 모델이 사람의 지시를 따르도록 만드는 과정 ChatGPT 같은 대규모 언어 모델은 다음에 올 가능성이 높은 토큰을 예측하는 방식으로 문장을 생성합니다.그런데 단순히 문장을 잘 생성하는 능력과 사람이 원하는 방식으로 답하는 능력은 같은 문제가 아닙니다.사용자가 질문했는데 관련 없는 내용을 길게 답하거나, 지시한 형식을 무시하거나, 도움이 되지 않는 답변을 만든다면 언어 생성 능력이 뛰어나더라도 실제 서비스에서는 사용하기 어렵습니다.그래서 대규모 언어 모델을 실제 AI 서비스로 만드는 과정에서는 모델의 행동을 사람의 의도와 기대에 더 잘 맞도록 조정하는 과정이 중요합니다.이와 관련해 자주 등장하는 개념이 AI 정렬(AI Alignment)입니다.이번 글에서는 AI 정렬이란 무엇인지부터 사전학습만으로 부족한 이유, 지시 학습과 인간 피드백의 역할, R.. 2026. 9. 27. 이전 1 다음