ChatGPT 멤버가 만든 193배 빠르다는 AI – Jev 완전 분석 그리고 인사이트

개요

타입세이프 AI가 출시한 Jev라는 모델이 기존 LLM 대비 193배 빠르고 444배 싸다고 주장한다. 이 영상은 Jev가 정말 새로운 종류의 모델인지, 아니면 마케팅 언어인지를 따져보며, 결론적으로 “절반은 진짜고 절반은 이미 있던 것”이라고 분석한다. 핵심은 RLHF로 훈련된 LLM이 채우지 못하는 “사람이 안 보는 판단” 영역에 Jev가 처음 들어온 틈새 상품이라는 점이다.

이 영상은 로나처 채널에서 AI 모델과 기술 트렌드를 깊이 있게 분석하는 콘텐츠로, OpenAI 출신 디오고 알메이다의 발표와 기술 보고서를 직접 인용하며 근거 기반으로 설명한다.

핵심 내용

Jev의 정체 — 말하는 기계가 아닌 고르는 기계

Jev를 만든 디오고 알메이다는 OpenAI에서 GPT-4와 ChatGPT, RLHF 논문의 공동저자로 참여했던 인물이다. 그는 오픈 AI를 나와 타입세이프를 창업했고, 공개 트위터 조회수가 3,600만을 넘겼다.

Jev는 스스로를 LLM이 아닌 “시스템 원 모델”이라 부른다. 기존 LLM이 글자를 하나씩 이어 붙여 답을 생성하는 “말하는 기계”라면, Jev는 주어진 선택지 중에서 고르기만 하는 “객관식 문제 풀이 기계”다. 질문 형태는 딱 세 가지로 제한된다: 초이스(선택지 고르기), 스코어(점수 매기기), 그리고 예/아니오 판단이다.

한 글자씩 생성하는 대신 한 번에 답을 내놓기 때문에 응답 시간이 0.07초에서 0.5초 사이이며, 프론티어 모델 대비 40배에서 200배 빠르다. 입력 비용은 토큰당 4센트 수준이고, 출력 토큰은 아예 무료다.

GPT에게 예/아니오만 시키면 되는 거 아닌가?

영상에서는 이 자연스러운 의문을 직접 다룬다. LLM에 “예 아니오로만 대답해”라고 프롬프트를 걸면 되지 않냐는 것이다. 여기에 세 가지 차이가 있다.

첫째, 출력을 줄여도 모델 자체는 그대로다. 한 단어만 답하라고 해도 LLM은 프롬프트 전체를 읽고 거대한 모델을 통째로 한 번 돌린다. 영상의 비유를 빌리면 “소설가한테 한 단어만 쓰라고 해도 유명한 소설가라면 일당은 그대로 드려야 하는 것”과 같다. Jev는 애초에 구조가 다른 모델이라 비용 자체가 낮다.

둘째, 형식 보장(타입 에러 불가능)은 회사가 크게 내세우지만, 이건 이미 LLM API의 스트럭처드 아웃풋이나 JSON 스키마 강제로 가능한 기본기에 가깝다. 영상에서는 이 부분을 “솔직히 마케팅”이라고 평가했다.

셋째, 진짜 차별점은 확률의 정확도, 즉 캘리브레이션이다. 이것이 Jev의 핵심이다.

RLHF의 구조적 한계와 캘리브레이션

RLHF는 ChatGPT를 갑자기 쓸 만하게 만든 훈련 방법이다. 영상에서는 3단계로 설명한다: 사람이 모범 답안을 작성하고, 모델의 여러 답변에 순위를 매겨 채점기를 만들고, 이 채점기로 모델을 자동 조정한다.

문제는 채점기가 “사람이 좋아할 답”에 높은 점수를 준다는 점이다. 사람은 우물쭈물하는 답보다 자신 있는 답을 좋아하기 때문에, 모델이 애매할 때도 단정적으로 말하는 버릇이 든다. 알메이다의 표현을 빌리면 “우리가 말 그대로 사람을 루프 안에 넣었기 때문”이다.

실제로 GPT-4 기술 보고서에 사전 학습만 한 모델은 확률이 정직했는데 RLHF를 거치고 나서 캘리브레이션이 무너졌다는 그래프가 있다고 영상에서 언급했다.

Jev는 RLHF 대신 RLCD라는 방식을 사용해 훈련 목표를 “사람이 좋아할 답”이 아닌 “정직한 확률”로 설정했다고 주장한다. “스팸입니다”가 아니라 “스팸일 확률 93%”라고 답하고, 그 93%가 실제 적중률과 일치하도록 훈련됐다는 것이다.

여기서 영상은 정확도와 캘리브레이션의 차이를 명확히 구분한다. 정확도는 “몇 퍼센트 맞추느냐”이고, 캘리브레이션은 “자기가 몇 퍼센트 맞출지를 스스로 아느냐”다. 기상 예보로 비유하면, 강수 확률 70%라고 한 날들만 모았을 때 실제로 열 번 중 일곱 번 비가 왔다면 그 예보는 캘리브레이션이 잘 된 것이다.

이것이 실무에서 중요한 이유는 개발자가 임계값을 설정할 수 있기 때문이다. 95% 넘으면 자동 처리, 그 밑은 큰 모델이나 사람에게 넘기는 구조가 가능해진다.

실제 사용 사례

버셀 엔지니어는 명령어 안전성 분류기를 Jev로 바꿔서 5배에서 18배 빨라지면서 정확도도 올랐다고 했다. 브리오 AI CTO는 이메일 분류에서 제미나이가 근소하게 더 정확했지만 10배에서 20배 비쌌다면서, 진짜 확률을 돌려주는 유일한 모델이라는 점을 더 높이 샀다고 했다.

제러드 워치라는 개발자가 Jev로 트레이딩 봇을 만든 데모도 X에서 조회수 100만을 넘겼다. 자산 가격 피드를 넣으면 Jev가 매매 판단을 확률과 함께 내리고 실제 거래를 실행하는 구조다. 영상에서는 이 데모 자체가 수익을 냈다는 증거는 없고 10초짜리 영상이라고 유보하면서도, “확률이 정직하다면 85% 이상일 때만 진입이라는 규칙을 세울 수 있는” 구조적 장점에 주목했다.

유보해야 할 지점들

영상은 장점만 나열하지 않고 명확한 유보 지점을 다섯 가지 제시했다.

  1. 벤치마크를 자기들이 만들었다. 193배라는 숫자도 “실제 이득의 상단에 가까울 것”이라고 회사 스스로 인정했다.
  2. 가격이 보조금이 아니라는 걸 증명할 수 없다고 본인들이 밝혔다.
  3. 환각을 없앤 게 아니라 사용자에게 넘긴 측면이 있다. 임계값을 잘못 잡으면 조용히 틀린 결정이 파이프라인 깊숙이 묻힐 수 있다.
  4. 아키텍처를 공개하지 않는다. 오픈소스 LLM 위에 올린 것 아니냐는 의심이 있고 반박이 없다.
  5. 공개 4일 만에 버셀 CTO 자레드 팔머가 Kev라는 오픈소스 복제본을 만들었다. API 형태는 며칠이면 따라 만들 수 있다는 뜻이다.

3층 구조 — 사람이 보는 일, 사람이 안 보는 일

알메이다는 발표에서 AI 시스템을 3층으로 분류했다. 맨 위는 사람과 대화하는 LLM 층(어시스턴스), 맨 아래는 0.01초 단위로 반응하는 로봇 컨트롤러(폴리시 네트워크), 가운데는 아무도 안 보는데 초 단위로 내려야 하는 판단이다.

“이 메일 스팸인가?”, “이 요청 사람한테 넘길까?”, “이 명령을 실행해도 되나?” 같은 중간층 판단을 지금은 위층의 LLM이 억지로 떠맡고 있다. RLHF로 훈련된 LLM은 사람 만족이 목표 함수였기 때문에 이런 자동화 판단에는 목표가 안 맞는다.

알메이다의 도발적 문장: “클로드 코드도 여전히 어시스턴트 시대다. 코드가 돌아가게 하는 것만 목표였다면 지금 같은 대화 방식이 아니었을 것.” 그가 말하는 건 대체가 아니라 분리다. 사람이 보는 일은 지금처럼, 사람이 안 보는 일만 다른 방식으로 가자는 것이다.

스타크래프트 데모와 미래 전망

필유 유셉이라는 개발자가 98년 원조 스타크래프트를 브라우저에서 돌리고 Jev에게 조종을 맡겨 미션 하나를 클리어했다. 다만 “추론 중에는 게임을 일시 정지한다”는 제약이 있어 실시간은 아직 안 된다.

만약 Jev 같은 중간층 모델이 텍스트를 넘어 화면이나 상태를 직접 받게 된다면, 게임마다 새로 만들지 않아도 되는 범용 판단 계층이 생길 수 있다. 영상에서는 이것이 게임보다 로봇이나 업무 자동화 쪽에서 먼저 터질 수 있다고 전망했다.

실전 가이드

먼저 자신의 시스템에서 LLM에게 예/아니오나 분류만 시키고 있는 API 호출이 몇 개인지 세어본다. 이메일 스팸 판별, 명령어 안전성 분류, 콘텐츠 필터링 같은 호출이 대표적이다.

다음으로 해당 호출에 Jev API를 적용해본다. 질문을 초이스, 스코어, 예/아니오 세 가지 형태 중 하나로 변환하고, 응답으로 받는 확률값을 기반으로 임계값을 설정한다. 95% 이상이면 자동 처리, 그 이하면 기존 LLM이나 사람에게 에스컬레이션하는 구조를 만들 수 있다.

마지막으로 비용과 정확도를 비교 측정한다. 기존 LLM 호출 대비 비용 절감과 응답 속도 개선을 정량적으로 확인하되, 캘리브레이션이 실제로 정직한지 샘플로 검증해야 한다.

비판적 검토

영상은 Jev의 기술적 원리와 포지셔닝을 명확하게 분석하고, 장점뿐 아니라 유보 지점 다섯 가지를 솔직하게 제시한 점이 인상적이다. 특히 RLHF의 구조적 한계에서 캘리브레이션 문제로 이어지는 논리 전개가 탄탄하다.

다만 Jev의 캘리브레이션 품질에 대한 독립적 검증이 아직 없다는 점은 아쉽다. Kev 같은 오픈소스 대안이 나오고 있고, 직접 파인튜닝한 작은 분류 모델이 여전히 더 싸고 빠를 수 있다는 점도 실무에서 함께 고려해야 한다.

핵심 요점

  1. 틈새 상품으로서의 Jev — 성능이 뛰어난 모델이 아니라, LLM이 억지로 떠맡던 “사람이 안 보는 판단” 영역에 처음 들어온 제품이다.
  2. 캘리브레이션이 진짜 차별점 — 정확도와 캘리브레이션은 다른 개념이며, 캘리브레이션이 좋으면 임계값으로 자동 처리와 에스컬레이션을 나눌 수 있다.
  3. RLHF의 구조적 편향 — 사람 만족을 목표로 훈련하기 때문에 애매할 때도 단정적으로 말하는 편향이 생긴다. 자동화에 부적합한 근본 이유다.
  4. 유보 사항 존재 — 자체 벤치마크, 보조금 가격 의혹, 아키텍처 비공개, 4일 만에 나온 오픈소스 복제본 Kev.
  5. 어시스턴스와 오토메이션의 분리 — 사람이 보는 일과 안 보는 일에 같은 모델을 쓰는 것은 비효율적이라는 프레임워크.

Leave a Comment