RLHF 이후의 AI, 사람을 돕는 답변과 믿고 맡기는 결정
Diogo Almeida의 강연을 바탕으로 인간 선호를 최적화하는 RLHF와 무인 자동화의 목표 차이, 확신 보정과 소프트웨어 의사결정의 과제를 정리한다.
TL;DR
- 어려운 문제를 푸는 능력과 사람이 지켜보지 않아도 일을 맡길 수 있는 신뢰성은 다르다. Almeida는 현재 AI를 인간의 참여를 전제로 한 보조에 강한 기술로 본다. Claude Code 역시 이 구분에서는 보조 시대에 속한다.
- RLHF는 인간의 선호를 학습 신호로 사용한다. 선호도가 높은 답변이 실제 업무의 성공이나 적절한 확신 수준까지 보장하지는 않는다. 다만 RLHF가 모든 환각의 원인이거나 추론 때마다 사람을 필요로 한다는 뜻은 아니다.
- 소프트웨어를 싸고 빠르게 만드는 것과 실행 중인 소프트웨어가 더 나은 결정을 하는 것은 별개의 변화다. 강연은 후자를 자동화의 다음 목표로 제시한다. 핵심은 더 많은 대화보다 반복 업무에 신뢰할 수 있는 지능을 넣는 데 있다.
- TypeSafe가 예고한 방향은 인간 선호나 정답 여부만이 아닌 확신 수준에 맞춘 의사결정이다. 발표자는 이를 RLVR과 구분하지만 구체적인 학습법과 성능은 공개하지 않는다. 9월 재게시 영상 안의 출시 전 설명은 원 강연이 공개된 7월의 맥락으로 읽어야 한다.
수학은 풀면서 고객 업무에는 사람이 남는 이유
Diogo Almeida는 GPT-4와 InstructGPT, ChatGPT 개발에 참여한 경험을 바탕으로 AI에 대한 상반된 평가를 한 질문으로 묶는다. 한쪽에서는 어려운 벤치마크와 장시간 작업 능력이 빠르게 개선된다고 말한다. 다른 쪽에서는 평범한 고객 업무조차 사람 없이 맡기기 어렵다며 실용성에 의문을 제기한다. 강연은 이 두 관찰을 단순히 낙관론과 비관론 중 하나로 정리하기보다 서로 다른 목표를 평가하고 있다고 해석한다.
그 구분이 보조와 자동화다. 보조에서는 사람이 결과를 읽고 방향을 조정하며 만족하는 과정이 업무의 일부다. 자동화의 이상은 사람이 매번 들여다보지 않는 서버에서 반복 업무가 안정적으로 실행되는 상태다. 수학 문제의 난도가 고객 업무보다 높아 보여도 오류의 비용, 판단 조건, 지속적인 감독의 필요까지 같지는 않다. 이 차이는 발표자의 설명 틀이며 모든 벤치마크가 보조만 측정한다는 뜻은 아니다.
인간의 선호와 실제 결과가 어긋날 수 있다
RLHF는 인간 피드백을 이용한 강화학습으로, 강연에서는 사람이 선호하는 출력을 수집하고 그 선호를 높이도록 모델을 최적화하는 과정으로 요약한다. Almeida의 비판은 이 목표가 무인 소프트웨어의 업무 성공과 자동으로 같아지지 않는다는 데 있다. 사용자가 좋아할 답을 만드는 능력은 좋은 보조 도구에 중요하지만 사용자가 보지 않는 곳에서 정확한 결정을 반복하는 데는 다른 평가가 필요하다.
그는 음향 효과를 음악이라고 소개했을 때 ChatGPT가 그럴듯한 감상평을 돌려준 사례로 사용자에게 맞장구치는 위험을 설명한다. 실제로 무엇을 아는지보다 만족스러운 반응을 만드는 쪽으로 기울면 틀린 답도 자신 있게 보일 수 있다. 과도한 약속과 결과 사이의 간극을 보상 목표의 문제로 해석하는 셈이다. 강연에서 언급한 과거 연구의 수치는 바뀌었을 수 있다고 발표자도 인정하므로 그 사례를 현재 모델 전체의 성능 수치로 옮길 수는 없다.
이 인과 설명에는 범위를 분명히 해야 한다. 학습 때 인간의 피드백을 받았다는 사실이 배포된 모델의 매 추론에 사람이 반드시 참여해야 한다는 논리적 조건은 아니다. 또한 OpenAI의 초기 InstructGPT 소개는 GPT-3보다 사실을 지어내는 빈도가 줄었다고 보고하면서도 환각이 남는다고 설명한다. 따라서 RLHF가 환각의 유일한 원인이라고 단정하기보다, 선호 신호와 실제 업무 결과를 따로 검증해야 한다는 문제로 읽는 편이 정확하다.
Claude Code도 같은 시대에 속한다는 주장
Almeida는 Claude Code를 유용한 도구로 평가하면서도 ChatGPT 이후의 전혀 다른 자동화 시대라고 부르지는 않는다. 대화 방식과 사용자 의도를 따르는 행동에 인간 선호 최적화의 영향이 남아 있다는 이유다. 코드 작업을 더 길게 수행하거나 여러 도구를 호출하는 능력이 향상돼도 사람이 계속 조정해야 하는 관계는 유지될 수 있다. 이 분류는 발표자의 관점이며 특정 제품의 전체 학습 구성이나 모든 사용 사례를 확인한 분석은 아니다.
그는 RLVR, 즉 검증 가능한 보상을 이용한 강화학습으로 정답을 잘 맞히게 만드는 방향과 사용자 의도에 잘 따르게 하는 방향도 구분한다. 에이전트 작업에는 능숙해졌지만 사용자가 실제로 원하는 행동과 어긋나는 경우가 생길 수 있다는 지적이다. 어느 한쪽의 점수를 높였다는 사실만으로 신뢰할 수 있는 무인 운영이 성립하지는 않는다. 강연은 보조 제품을 버리자는 주장보다 자동화가 요구하는 목표를 별도로 세우자는 문제 제기에 가깝다.
더 싼 소프트웨어와 더 똑똑한 소프트웨어
AI가 코드를 대신 작성하면 기존 방식의 프로그램을 더 빨리 만들 수 있다. 그러나 실행되는 프로그램의 판단 방식과 표현력이 그대로라면 제작 비용이 낮아진 변화와 소프트웨어 자체가 더 지능적으로 작동하는 변화는 다르다. Almeida는 기존 SaaS 옆에 챗봇을 붙이는 패턴을 이 차이의 사례로 든다. SaaS가 거의 변하지 않았다는 표현은 그의 비판적 평가이며 산업 전체를 측정한 결과는 아니다.
그가 원하는 자동화의 단위는 한 사람의 직무 전체를 한꺼번에 대체하는 거대한 에이전트만이 아니다. 무엇을 해야 할지 다른 사람에게 설명할 수 있을 정도로 정형화된 작은 업무가 소프트웨어 안에서 반복 실행되는 상태다. 필요할 때 코드를 생성하는 편리함을 인정하면서도, 그 안에 넣을 수 있는 지능의 구성 요소가 왜 여전히 제한적인지 묻는다. 제작을 돕는 AI와 운영 중 판단을 수행하는 AI의 차이가 여기서 드러난다.
기업의 고객지원 사례에는 오류 비용을 누가 부담하는지도 얽힌다. 사용자를 긴 문서와 안내로 돌리는 일은 자동화하면서 회사에 금전적 손실을 줄 수 있는 결정은 사람이 맡는 패턴을 발표자는 비판한다. 겉으로는 AI를 많이 써도 결과가 중요한 결정은 여전히 수동일 수 있다. 이는 모든 기업이 같은 정책을 쓴다는 사실 주장보다 도입의 범위와 책임 배분을 살펴보자는 관찰이다.
사전 학습의 지능을 어떻게 꺼내 쓸 것인가
질의응답에서 Almeida는 사전 학습 자체를 주된 문제로 보지 않는다고 답한다. 인터넷의 지식을 활용 가능한 지능으로 압축한 성과는 높게 평가하며 그 지능을 어떤 목표로 끌어내는지가 중요하다고 본다. 분류기 헤드를 사전 학습과 함께 학습하자는 질문에는 주어진 시간 안에 구체적인 답을 내놓지 않는다. 이 부분을 특정 아키텍처를 채택하거나 거부했다는 결론으로 보충할 수는 없다.
그는 불확실한 태도는 보상 모델이 알아보기 쉬워 벌점을 받기 쉽고 그 결과 모델이 여러 가능성을 유지하기보다 확신을 드러내는 쪽으로 갈 수 있다고 설명한다. GAN의 모드 드롭과 비교하지만 정식 유도나 실험을 제시하지는 않는다. 자동화에서는 자신 있어 보이는 말투보다 판단의 확신이 실제 신뢰도와 얼마나 맞는지가 중요하다. 강연의 주장은 그 차이를 최적화 목표에 반영하자는 방향으로 이어진다.
확신 수준에 맞춘 결정은 아직 검증할 제안이다
TypeSafe가 무엇을 만드는지 묻는 질문에 발표자는 새로운 방식이 RLVR은 아니라고 명확히 답한다. 그의 비교에서 RLHF는 인간 선호, RLVR은 검증 가능한 정답 여부에 초점을 두며 제안하는 세 번째 방향은 확신 수준에 맞춘 의사결정이다. 데이터와 연산량을 늘리는 일에 앞서 무엇을 최적화할지 올바르게 고르는 것이 중요하다는 주장이다. 보상을 과정 전체에 주는지 묻는 후속 질문에도 구체적인 방식 대신 API의 형태부터 달라질 것이라고 답한다.
영상 제목은 Jev를 내세우지만 강연 안에서 회사는 아직 공개를 준비하는 TypeSafe로 소개된다. 원 채널 AI Engineer의 영상은 2026년 7월 31일 공개됐고 한국어 자막판은 9월 19일 재게시됐다. 따라서 발표 당시의 출시 예고를 현재 제품 상태로 옮기거나 이후 공개된 성능 수치를 이 강연의 근거처럼 붙여서는 안 된다. 이 발표에서 확인되는 것은 신뢰성과 자동화를 중심에 둔 설계 방향이며 구체적인 알고리즘과 보정 성능, 운영상 오류 비용은 별도의 검증 과제로 남는다.
참고 자료
| [평범한 사업가 | AI SuperUser — Jev CEO가 이야기하는 AI 자동화가 어려운 이유](https://www.youtube.com/watch?v=Sz4QYVV1gvY) |
AI Engineer — What’s next after RLHF? 강연 소개·전사·해설
OpenAI — Aligning language models to follow instructions
한국어 수동 자막 전체와 영어 자동자막을 대조하고 원 채널의 공개일을 확인했다. 발표자의 인과 해석과 검증된 학습 결과를 구분했으며, InstructGPT의 환각 관련 설명은 OpenAI 원문으로 보충했다.
