[인간이 쓴 글입니다.] "445배 싸고 200배 빠르다"는 Jev(TypeSafe System One), 진짜 붙여봤습니다 — LLM 버리고 정확도 95.8%
Moket은 "이런 걸 하고 싶은데 어떤 AI를 쓰면 되냐"는 질문에서 시작한 서비스입니다.
유튜브 자막을 자동으로 만들고 싶다, 회의 녹음에서 화자를 구분하고 싶다, 배경을 지운 제품 사진이 필요하다.
작업은 제각각이지만 우리가 할 일은 하나입니다. 카탈로그에 실제로 있는 도구 중에 제일 맞는 걸 하나 골라주는 것.
chat gpt 한테 물어보면 되는 것 아니야? 라고 하실수 있겠지만 저는 항상 추천 받은 걸로 시작해서 정보가 늘어나면 결국 다른 더 좋은 도구로 바꾸게 되었습니다.
LLM은 단순히 구글 웹서핑 해서 가장 상단에 있는 광고나 블로그 긁어와서 도구를 추천해 준다는 느낌을 받았고 이렇게 하면 구글 광고를 가장 적극적으로 한 도구를 추천해 주겠구나란 생각이 들었습니다.
그래서 AI 도구 목록을 직접 만들었고 거기에 LLM을 붙여서 골라달라고 하는 시스템을 만들었습니다.
그러나 LLM은 결국 글을 쓰는 모델입니다. "골라줘"라고 해도 문장을 만들어냅니다.
가끔은 우리 카탈로그에 있지도 않은 도구를 그럴듯하게 지어냈습니다.
정보 사이트에서 이건 좀 치명적이죠.
느리기도 하고요. 간단한 선택인데 한 글자씩 생성하느라 시간이 걸립니다.
무엇보다, 사실은 "이건 목적이 불분명해요"라고 해야 할 때조차 억지로 하나를 골라줬습니다.
우리한테 필요한 건 유창한 문장이 아니라 정확한 결정이었습니다.
이런 과정에서 하네스 엔지니어링, 도구 벡터화 등등 굉장히 많은 시도를 하였지만 정확도는 80%를 넘지 못했습니다.
결국 LLM을 붙이는 것을 포기하고 고정된 값들을 주는 아날로그 시스템을 라이브에 올려두었습니다.
이때 Jev가 등장하였습니다.
전세계를 강타한 모델로 글을 한 글자씩 쓰는 대신 구조화된 '결정'을 바로 내줍니다. 어떤 선택지를 골랐는지, 얼마나 확신하는지를 같이 보내주는데 할루시네이션이 없다고 광고합니다. 정해진 선택지 안에서 판단하는 일에선 일반 LLM보다 훨씬 빠르고 싸다고 합니다. 말솜씨보다 속도와 정확성이 중요한 곳을 노리고 나온 모델입니다.
우리 서비스의 문제점에 딱 맞는 모델이었습니다.
사용자가 하려는 작업을 적으면, 우리가 카탈로그에서 관련 있는 실제 도구 후보를 먼저 추립니다.
그 다음 Jev한테 "이 목록 중에서 판단해"라고 넘깁니다.
하나를 고르거나, 애매하면 "목적이 불분명함 / 조건이 부족함" 같은 보류 사유를 고르게요.
핵심은 Jev한테 답을 창작하게 두지 않는 겁니다.
있는 것 중에서 고르는 판단만 맡깁니다.
Jev는 답을 창작하지 않습니다. 있는 후보 중에서 '결정'만 합니다.
장점은 일단 빠릅니다. 대개 1~2초면 답이 나옵니다.
없는 도구를 만들어내지 않습니다.
그리고 정직하게 보류할 수 있게 됐습니다.
억지 추천 대신 "조건이 좀 더 필요해요"라고 말할 수 있으니, 오히려 추천을 더 믿게 됐습니다.
비용도 거의 안 듭니다.
물론 Jev가 만능은 아닙니다.
글을 쓰거나 설명을 만드는 일엔 안 맞습니다.
아직 초기 단계라 기능이나 조건이 바뀔 수 있고, 벤치마크 숫자가 실제 체감이랑 다를 수도 있습니다.
직접 만들었던 테스트셋에서 정확도 95.8%의 좋은 성능을 보였지만 역시 100%는 아닙니다. (사실 100%는 불가능합니다.)
그래서 지금은 회원분들 대상으로 조심스럽게 테스트하면서 실제로 어떻게 쓰이는지 보고 있습니다.
우리가 하려는 건 "더 대단한 AI"를 자랑하는 게 아니라, 여러분이 자기 일에 맞는 AI를 더 잘 고르게 돕는 것입니다.
그 과정에서 도구를 고르는 판단 자체도, 제일 맞는 모델을 골라 쓰려고 계속 바꿔보고 있습니다.
아마 이번 추석은 Jev를 위한 input output 구조를 다듬는데 다 쓸 것 같습니다.
David Lee
Moket Editor
