학습법을 바꿨다 — 인간 선호도, 검증가능 보상 대신 '아는 만큼만 확신하는' 정직한 확률을 목표로
캘리브레이션(calibration)은 모델이 말하는 확신도가 실제 정답률과 일치하는 성질입니다. 확신 90%로 내린 결정들을 모아보면, 실제로 그중 약 90%가 맞아야 잘 보정된 것입니다.
💡 JEV(보라색)는 대각선 완벽 보정선에 딱 붙습니다(일치) — 확신 90%면 실제로 ≈90% 맞음. LLM(주황색)은 대각선 아래로 처져 같은 확신에도 실제 정답률이 낮습니다(과신). JEV의 목표는 '인식론적으로 정직한 확률' — 쉽게 말해 아는 만큼만 확신하고, 모르면 모른다고 말하는 확률입니다.
기존 LLM은 RLHF(인간 선호도)나 RLVR(검증가능 보상)로 학습합니다. JEV는 대신 RLCD(Reinforcement Learning for Calibrated Decisions) — 캘리브레이션된 결정을 목표로 학습합니다.
| 학습법 | 최적화 목표 | 부작용 / 특징 |
|---|---|---|
| RLHF | 인간 선호도에 맞춤 | 듣기 좋게 말하려다 과신 |
| RLVR | 검증가능한 보상 최대화 | 정답만 보상, 확신도는 방치 |
| RLCD | 캘리브레이션된 결정 · 정직한 확률 | 확신도 = 실제 정답률 |
💡 "얼마나 그럴듯한가"가 아니라 "얼마나 확신해야 정직한가"를 직접 학습 신호로 삼은 것이 핵심 차이입니다.
💡 위 수치는 개념 이해를 돕기 위한 예시입니다 — 과신(확신도 > 정답률)과 캘리브레이션(확신도 ≈ 정답률)의 차이를 보여줍니다.
이것으로 2강 'JEV 아키텍처의 심장'을 마칩니다. 타입 안전·병렬·캘리브레이션이라는 원리를 알았으니, 이제 실제로 어떻게 질문하는가로 넘어갑니다. 3강에서는 JEV의 세 가지 프리미티브 — Choice · Score · Noul — 를 하나씩 익힙니다.