4-워크플로 벤치마크 — 지능은 비슷, 효율은 두 자릿수 우위
TypeSafe는 JEV를 4개의 실제 워크플로로 구성된 벤치마크에서 측정했습니다. 비교는 세 축으로 이뤄집니다 — 지능(정확도), 속도(지연), 비용. 결론을 먼저 말하면 이렇습니다: 지능은 중상위 LLM과 근접하지만, 속도와 비용은 두 자릿수(수십~수백 배) 앞섭니다.
💡 이번 강의는 이 세 축을 하나씩 숫자로 뜯어봅니다. 마지막엔 "지능은 비슷, 효율은 압도"라는 한 문장으로 모입니다.
💡 LLM은 토큰을 하나씩 만들어 3–329초가 걸리지만, JEV는 단일 쿼리 병렬 평가로 70–500ms에 끝냅니다. 사람이 느끼기엔 "즉시"에 가깝죠. 그래서 나에게 무슨 의미냐면 — 느려서 AI를 못 넣던 실시간 화면에도 이제 직접 넣을 수 있다는 뜻입니다.
💡 입력은 100만 토큰당 $0.042, 출력은 아예 무료("too cheap to meter")입니다. LLM 대비 40–400× 저렴하죠. 쉽게 말해 비용이 더는 병목이 아니게 되니, 대량·실시간 경로에도 부담 없이 넣을 수 있습니다.
| 관점 | 중상위 LLM (예: GPT-5.6 Terra) | System One + JEV |
|---|---|---|
| 정확도 | 중상위권 (기준) | ~68% (근접) |
| 속도 | 3–329초 | 70–500ms (40–200×) |
| 비용 | 기준 | 40–400× 저렴 |
| 환각·타입 에러 | 발생 가능 | 0 (수학적 보장) |
여기서 자연스러운 질문이 나옵니다. "이렇게 싸고 빠르면 LLM은 이제 필요 없나요?" 답은 아니오입니다. 4-3강에서는 JEV와 LLM이 어떻게 역할을 나눠 함께 쓰이는지 — 하이브리드 아키텍처를 다루고, 4강 전체와 강의 전체를 마무리합니다.