Laya 진짜 추천합니다. Jev를 오픈소스로 쓰는법

개요

AI 서비스를 만들 때 모든 요청을 최고 성능의 모델에 보내면 비용과 응답 시간이 함께 불어납니다. 이 영상은 요청을 먼저 분류해 알맞은 처리 경로로 보내는 “라우팅” 단계에, 요즘 주목받는 모델 제브 대신 오픈소스 모델 라야를 직접 학습시켜 쓸 수 있는지 실험한 결과를 보여 줍니다. 평범한 M4 프로 맥북, 램 24GB 환경에서 1천 건을 48분 동안 학습시켰더니 한국어 고객 지원 분류 시험의 정답률이 32.8%에서 86.4%로 올랐고, 1만 건을 학습시킨 뒤에는 검증 문제에서 99.7%까지 도달했습니다.

이 영상은 클로드 코드, 커서, 안티그래비티 등 AI 개발 도구와 바이브코딩을 꾸준히 다뤄 온 코드팩토리 채널의 콘텐츠입니다. 발표자는 앞서 제브를 소개한 영상의 연장선에서, 며칠에 걸쳐 직접 학습과 테스트를 진행한 결과를 공유합니다.

핵심 내용

라우팅이 필요한 이유와 고객 지원이 적합한 이유

발표자는 먼저 라우팅의 개념을 정리합니다. 사용자의 요청을 전부 가장 좋은 LM에 보내면 구현은 편하지만, 간단한 조회 하나까지 최고 모델을 거치면 호출 비용과 응답 대기 시간이 크게 늘어납니다. 반대로 저렴하고 빠른 모델에 모든 일을 맡기면 복잡한 요청에서 답변 품질이 떨어집니다. 그래서 요청을 먼저 보고 “간단한 처리로 충분한지, 더 강력한 모델이 필요한지, 사람이 직접 확인해야 하는지, 아예 답장이 필요 없는지”를 나누는 것이 라우팅입니다.

제브는 이런 목적에 쓸 수 있습니다. 답변을 작성할 LM 앞단에 제브를 두고 요청과 선택지를 주면 제브가 경로를 고르고, 프로그램은 그 결과에 따라 해당 모델로 요청을 보냅니다. 결과적으로 큰 모델은 꼭 필요한 요청에만 쓰게 되어 시간과 돈을 아낄 수 있습니다.

고객 지원이 라우팅에 특히 잘 맞는 이유도 설명합니다. 문의마다 해야 할 일이 크게 다르고, 들어오는 데이터가 방대해서 잘못 처리하면 많은 돈을 낭비하게 됩니다. 영상에서 든 예시는 이렇습니다.

  • “배송이 어디까지 왔나요” → 주문 정보를 조회해 안내
  • “반품하고 싶어요” → 반품 가능 여부를 확인하는 절차로 연결
  • 규정만으로 해결하기 어려운 분쟁 → 실제 상담원에게 바로 넘김

문제는 단어만 보고 판단하면 헷갈린다는 점입니다. “배송이 늦어요”와 “배송이 늦으니까 취소해 주세요”는 둘 다 배송 이야기지만, 두 번째 고객이 원하는 것은 분명히 취소입니다. 여기서 라우팅이 틀리면 뒷단에서 아무리 답변을 잘 써도 고객이 원하는 처리를 할 수 없습니다. 이것이 AI 분류기가 필요한 이유입니다.

실험 설계: 한국어 고객 지원 문의 6개 분류

발표자는 라야가 영어를 조금 더 잘한다는 점을 언급하면서도, 시청자 대부분이 한국어로 작업할 것을 고려해 한국어 문의로 실험을 설계했습니다.

  • 과제: 한국어 문의를 읽고 배송, 취소, 교환 반품 등 여섯 가지 항목 중 하나로 분류
  • 데이터: 온라인 쇼핑몰에서 있을 법한 한국어 문의와 정답을 짝지은 합성 데이터
  • 시험 문제: 학습용과 별도로 250개를 미리 떼어 두고, 모든 단계에서 같은 시험으로 비교
  • 학습 방식: 문의와 정답 분류를 함께 보여 주고, 모델의 예측을 정답과 비교해 가중치를 조금씩 조정

발표자의 처음 예상은 “1천 건 정도 가르치면 제브와 라야가 비슷해지지 않을까”였습니다.

학습량에 따른 정답률 변화

학습 전 라야의 기본 성능은 250개 중 82개, 정답률 32.8%였습니다. 세 문제 중 하나 정도만 맞힌 셈이라 바로 쓸 수 있는 수준이 아닙니다.

학습 데이터학습 시간정답률맞힌 문제
학습 전–32.8%82 / 250
100건4분68.8%172 / 250
300건15분83.2%–
1,000건48분86.4%216 / 250
제브 (학습 없음)–100%250 / 250

눈에 띄는 점은 첫 100건의 효과입니다. 고작 4분 학습으로 맞힌 문제가 90개 늘었습니다. 반면 300건에서 1,000건으로 늘릴 때는 데이터를 훨씬 많이 넣었는데도 정답률은 83.2%에서 86.4%로 조금만 올랐습니다. 학습량을 늘릴수록 개선 폭이 줄어드는 현상입니다.

실험 방식에 대해서도 짚어 둡니다. 100건으로 학습한 모델에 데이터를 덧붙여 나간 것이 아니라, 각 단계 모두 학습 전 기본 모델에서 새로 출발했고 학습 데이터량만 다르게 줬습니다. 시험 문제는 동일하게 유지했습니다.

제브와의 비교, 그리고 1만 건 학습

같은 250문제에서 제브는 하나도 틀리지 않고 100%를 기록했습니다. 발표자는 “잘할 거라고 생각은 했지만 하나도 안 틀릴 거라고는 생각하지 못했다”며, 1천 건 학습으로는 성능 차이가 분명히 있었다고 인정합니다.

그래서 학습량을 극단적으로 1만 건까지 늘려 봤습니다. 같은 맥북에서 7시간 52분이 걸렸고, 이번에는 검증용 문제 600개로 평가했습니다.

  • 학습 전 라야: 35.8%
  • 1만 건 학습 후: 99.7% (600개 중 598개)

발표자는 이로써 제브가 보여 준 100%에 거의 근접했다고 평가합니다. 다만 제브는 범용 모델이라 학습 없이도 다른 분야에서 잘할 것이기 때문에 “라야가 제브를 완전히 따라잡았다고 말할 수는 없다”고 선을 긋습니다. 증명된 것은 “쓰고 싶은 특정 영역에 대해 학습시키면, 학습 건수와 데이터 정확도에 따라 매우 높은 정답률을 만들 수 있다”는 점입니다.

틀린 문제에서 배우는 재학습 전략

라야가 틀린 사례도 구체적으로 소개됩니다.

  • 머그컵 반품 송장 문의: 이미 반품이 접수된 상황이라 기준상 교환 반품으로 가야 하는데, 라야는 배송으로 분류했습니다. 발표자는 “틀릴 수도 있겠다” 싶은 경우로 봤습니다.
  • 키보드 색상 옵션 비교 문의: 구매 전에 색상을 비교하는 상황이라 상품 문의여야 하는데, 교환 반품으로 보냈습니다. 발표자는 “너무 황당하게 틀렸다”고 평가합니다.

실전이라면 고객 지원팀이 정답만 고치고 끝내지 않고, 헷갈릴 만한 상황을 모아 두는 방식을 제안합니다. 예를 들어 “구매 전에 색상을 묻는 경우”와 “이미 받은 제품을 다른 색상으로 교환하는 경우”를 나란히 학습 데이터에 넣어, 어떤 차이 때문에 분류가 달라지는지 모델이 배우도록 유도하는 것입니다. 그다음 학습에 넣지 않은 새로운 문의로 다시 시험해 구분 능력을 확인합니다.

응답 속도와 로컬 실행의 장점

라우팅은 본격적인 답변 생성 전에 반드시 거치는 단계라서, 여기서 지연이 생기면 뒷단 LM이 답변을 시작하는 시간도 그만큼 늦어집니다. 정확도만큼 속도가 중요한 이유입니다.

  • 제브 API: AI 게이트웨이를 통해 호출, 요청부터 결과 수신까지 중앙값 약 0.5초
  • 1천 건 학습한 라야: 맥북에서 한 건 분류에 0.11초

발표자는 이것이 제브 모델 자체가 느리다는 뜻이 아니라고 강조합니다. 제브는 인터넷을 오가며 서버 처리 시간까지 포함되고, 라야는 로컬에 띄워 둔 모델로 분류한 시간이기 때문입니다. 라야를 같은 컴퓨터나 같은 네트워크 안에서 돌리면 고객 문의를 외부 서버로 보내지 않고 내부에서 분류할 수 있어, 외부로 보내기 어려운 자료를 다루는 회사라면 이 선택지가 더 의미 있을 수 있습니다.

실전 가이드

영상의 실험 흐름을 내 업무에 적용하려면 다음 순서로 진행해 볼 수 있습니다.

1단계: 분류 기준과 시험 문제부터 고정하기

먼저 내 서비스에서 요청을 어떤 경로로 나눌지 정합니다. 영상처럼 고객 지원이라면 배송, 취소, 교환 반품, 상품 문의 같은 항목을 정하고 각 항목의 판단 기준을 문서로 남깁니다. 그다음 학습에 절대 쓰지 않을 시험 문제를 따로 떼어 둡니다. 영상에서는 250개를 미리 빼 두고 모든 단계에서 같은 시험으로 비교했습니다. 이 시험 세트가 있어야 학습 효과를 객관적으로 판단할 수 있습니다.

2단계: 작은 규모로 학습 효과 확인하기

처음부터 대량 학습을 하지 말고 100건 정도로 시작합니다. 영상에서는 100건 학습에 4분이 걸렸고 정답률이 32.8%에서 68.8%로 올랐습니다. 이후 300건, 1,000건으로 늘려 가며 정답률 변화를 기록하면, 내 과제에서 데이터를 더 넣을 가치가 있는 구간이 어디까지인지 파악할 수 있습니다. 영상처럼 300건에서 1,000건 구간의 개선 폭이 작다면, 무작정 양을 늘리기보다 다음 단계의 데이터 품질 개선이 더 효과적일 수 있습니다.

3단계: 틀린 문제로 데이터 보강하기

시험에서 틀린 문제를 모아 원인을 분석합니다. 키보드 색상 사례처럼 “구매 전 질문”과 “구매 후 교환”이 헷갈린다면, 두 상황을 대비시키는 예시를 함께 넣어 재학습합니다. 보강 후에는 학습에 넣지 않은 새로운 문의로 다시 시험해 실제로 구분 능력이 좋아졌는지 확인합니다.

활용 시나리오

  • 시나리오 A, 쇼핑몰 고객 지원: 단순 배송 조회는 주문 조회 로직으로, 반품 요청은 반품 가능 여부 확인 절차로, 분쟁은 상담원에게 넘기도록 앞단에 학습된 라야를 둡니다. 큰 모델 호출은 복잡한 문의에만 남겨 비용을 줄입니다.
  • 시나리오 B, 외부 전송이 어려운 사내 데이터: 고객 정보나 내부 자료를 외부 모델 서버로 보내기 곤란하다면, 라야를 같은 네트워크 안에서 돌려 분류 단계를 내부에서 처리합니다.
  • 시나리오 C, 응답 속도가 중요한 서비스: 라우팅 지연이 전체 응답 시간을 늦춘다면, 로컬 분류(영상 기준 0.11초)로 앞단 지연을 줄이고 뒷단 LM이 더 빨리 답변을 시작하도록 구성합니다.

비판적 검토

이 영상의 강점은 구체적인 숫자와 공정한 비교 설계입니다. 시험 문제를 고정하고, 각 학습 단계를 모두 기본 모델에서 새로 출발시켜 학습량의 효과만 분리해 보여 줬습니다. 학습 시간, 정답률, 응답 속도까지 기록해 실무자가 판단할 근거를 제공한 점도 좋습니다. 또 제브의 100% 결과를 그대로 인정하고, 1만 건 학습 후에도 “제브가 범용적으로 더 정확했다”고 밝혀 균형을 유지했습니다.

다만 해석할 때 주의할 점이 있습니다.

  • 1만 건 결과는 다른 시험으로 측정됐습니다. 1천 건까지는 250개 시험 문제를 썼지만, 1만 건 실험은 검증용 600개로 평가했습니다. 99.7%와 제브의 100%를 같은 조건의 비교로 보기는 어렵습니다.
  • 합성 데이터의 한계가 있습니다. 학습과 시험 데이터 모두 발표자가 만든 합성 데이터라, 실제 고객 문의의 오타나 애매한 표현에서는 결과가 달라질 수 있습니다.
  • 응답 속도 비교는 조건이 다릅니다. 제브는 네트워크 왕복이 포함된 API 시간이고, 라야는 로컬 실행 시간이라 모델 자체의 속도 비교가 아닙니다. 발표자도 이 점을 직접 언급했습니다.
  • 비용과 운영 부담은 다뤄지지 않았습니다. 데이터 준비, 재학습 주기, 로컬 모델 운영에 드는 노력은 영상에서 구체적으로 다루지 않았습니다.

발표자의 조언처럼, 정확도와 응답 시간, 직접 학습이 필요한지를 함께 따져 결정하고, 특히 “업무에서 절대 틀리면 안 되는 문의”를 잘 처리하는지 별도로 확인해야 합니다.

핵심 요점

영상을 본 후 기억해야 할 다섯 가지입니다.

  1. 라우팅은 비용과 속도를 함께 잡는 앞단 설계입니다. 모든 요청을 최고 모델에 보내지 말고, 요청을 먼저 분류해 큰 모델은 꼭 필요한 곳에만 쓰면 시간과 돈을 아낄 수 있습니다.
  2. 적은 데이터로도 큰 효과가 납니다. 라야는 100건, 4분 학습만으로 정답률이 32.8%에서 68.8%로 올랐고, 1천 건 48분 학습으로 86.4%에 도달했습니다. 특별한 GPU 없이 M4 프로 맥북, 램 24GB로 가능했습니다.
  3. 학습량을 늘릴수록 개선 폭은 줄어듭니다. 300건에서 1,000건으로 늘렸을 때 정답률은 83.2%에서 86.4%로 조금만 올랐습니다. 양보다 헷갈리는 사례를 대비시켜 넣는 데이터 보강이 더 효과적일 수 있습니다.
  4. 범용 성능은 여전히 제브가 앞섭니다. 같은 250문제에서 제브는 학습 없이 100%를 기록했습니다. 라야는 1만 건 학습으로 검증 문제 99.7%까지 올랐지만, 특정 영역에 맞춘 결과라는 점을 기억해야 합니다.
  5. 로컬 실행은 속도와 보안에서 강점이 있습니다. 로컬 라야는 0.11초, 게이트웨이를 거친 제브 API는 중앙값 0.5초였고, 내부 네트워크에서 분류하면 고객 문의를 외부로 보내지 않아도 됩니다. 내 업무에 딱 맞는 라우터가 필요하다면 검토할 가치가 충분합니다.

요약자 노트

  • 이 요약은 영상의 한국어 자동 자막을 바탕으로 작성했으며, 자막에 없는 외부 정보는 추가하지 않았습니다.
  • 자동 자막의 인식 오류로 일부 표현(예: “머그컵 반품 송장” 문의)은 문맥에 맞게 해석했습니다.
  • 여섯 가지 분류 항목 중 영상에서 명시적으로 언급된 것은 배송, 취소, 교환 반품, 상품 문의입니다.
  • 1만 건 실험의 학습 전 정답률 35.8%와 학습 후 99.7%는 250개 시험이 아닌 검증용 600개 문제 기준입니다.
  • 추출일: 2026-10-03

참고자료

영상에서 언급된 자료와 관련 출처입니다.

Leave a Comment