토큰을 하나씩 vs 모든 답을 한 번에 — 자기회귀를 버리자 3–329초가 70–500ms가 되었다
자기회귀는 각 토큰이 직전 토큰을 조건으로 계산되는 순차 의존 구조입니다. 앞 토큰 계산이 끝나야 다음 토큰을 시작할 수 있어, 총 지연이 출력 토큰 수에 비례해 누적됩니다.
💡 막대 길이 차이가 그대로 체감 속도 차이입니다. 초 단위 대기가 사라지고 '즉답'이 됩니다.
💡 한 요청에 여러 질문을 담아도 병렬로 평가되어, 응답 시간은 거의 늘지 않고 추가 질문의 토큰 비용만 발생합니다.
병렬·비자기회귀 구조에서는 요청 건수가 늘어도 개별 요청의 누적 지연이 커지지 않습니다. 그래서 sub-500ms 실시간 결정과 대규모 배치를 같은 구조로 처리할 수 있습니다.
빠르고 타입까지 안전해졌습니다. 그런데 그 답에 붙는 '확신도'를 믿어도 될까요? 2-3강에서는 RLCD와 캘리브레이션을 다룹니다. 학습법 자체를 바꿔서, 높은 확신이 실제로 높은 정답률이 되도록 만든 원리를 살펴봅니다.