TypeSafe AI, Jev 모델로 비트코인(BTC) 자동화용 70~500밀리초 타입 판단 공개

TypeSafe AI의 Jev 모델이 텍스트 생성 없이 70~500밀리초 만에 타입화된 확률 판단을 반환한다. 출시 한 주 만에 오픈소스 클론이 등장했다.

(오전 05:35 UTC)
3분 읽기
AI 요약AI
  • TypeSafe AI가 9월 15일 Jev를 최초의 System One 모델로 얼리 액세스 공개.
  • Jev의 응답 시간은 70~500밀리초, 비교 프런티어 모델군은 3~329초 소요.
  • 작업당 0.114초, 작업당 0.000081달러, 10억 입력 토큰당 42달러 주장.
  • Claude Fable 5.1 대비 입력 가격 238배 저렴, 종합 193.6배 빠르고 444.6배 저렴.
v3xn8bwc

70~500밀리초, 텍스트 생성 없이

AI 스타트업 TypeSafe AI가 9월 15일 Jev를 얼리 액세스로 공개했다. 회사는 이를 자사 최초의 System One 모델로 소개하는데, 이 카테고리는 언어가 아니라 판단 자체를 반환하는 소프트웨어로 정의된다. 공식 출시 발표에 따르면 Jev는 상태와 미리 정의된 질문 세트를 입력받아 병렬로 평가한 뒤 확률이 실린 타입화된 답변을 돌려준다. 어느 시점에도 문자열이 생성되지 않으므로, 애플리케이션 코드는 자유 텍스트를 파싱하는 대신 출력을 그대로 소비한다.

인터페이스는 세 가지 질문 유형을 노출한다. Choice는 고정 목록에서 하나의 옵션을 선택해 선택값, 옵션별 확률, 신뢰도를 반환한다. Score는 상태를 루브릭 기준으로 채점해 점수, 확률 분포, 신뢰도를 돌려준다. Noul은 명제의 참·거짓 여부를 판정해 0과 1 사이의 단일 숫자를 반환한다. 기술 문서는 세 유형을 단일 API 호출에서 섞을 수 있고, 질문을 추가해도 응답 시간이 거의 변하지 않으며 컨텍스트 오염도 발생하지 않는다고 명시한다.

확률 그 자체가 곧 제품이다. TypeSafe의 예시는 티켓 분류이다. 91% 엔지니어링 대 9% 청구 분할은 자동으로 라우팅되지만, 52% 대 48%로 갈리면 에스컬레이션이나 컨텍스트 추가, 더 강한 모델로의 이관이 트리거된다. 회사의 핵심 메시지는 “문자열이 아니라 결정”이다. 다만 주의할 점이 하나 있다. 타입 안전성은 형식 오류를 막을 뿐 판단 오류를 막지는 못한다. 선언되지 않은 옵션을 반환하지 못하는 모델이라도 선언된 옵션 중에서 틀린 것을 고를 수 있다. 성능 수치는 모두 TypeSafe 자신의 발표에 근거한다. System One 작업당 0.114초, 작업당 0.000081달러, 입력 토큰 10억 개당 42달러, 입력 가격은 Claude Fable 5.1 대비 238배 저렴, 종합 집계로 193.6배 빠르고 444.6배 저렴하다는 주장이다. 응답 시간은 70~500밀리초로, 비교 프런티어 모델군의 3~329초와 대비된다. 회사는 새 아키텍처, 병렬 샘플러, 그리고 RLCD(캘리브레이션된 결정 강화 학습) 훈련 기법을 그 근거로 꼽으며, 현재 개발자들이 얼리 액세스 대기 중이라고 밝혔다.

며칠 만에 등장한 오픈소스 복제

Hacker News의 공개 토론을 보면 카테고리 확산은 하루 남짓이 걸렸다. 9월 16일부터 로컬 GPU에서 구동되는 대체 구현, 기존 언어 모델로 Jev의 동작을 재현하는 에뮬레이션, 전용 지연시간 테스트 프로젝트가 차례로 나타났다. 다만 어떤 오픈 프로젝트도 TypeSafe의 독점 훈련 레시피를 재사용하지 않는다. 공통점은 인터페이스, 즉 고정 후보를 병렬 평가하고 루프 어디에서도 텍스트를 생성하지 않는 구조다.

Hugging Face에도 같은 방향의 모델이 올라왔다. 9월 16일 등록된 system-one-qwen3.5-4b-scorer는 Qwen3.5 기반으로, 문자열을 생성하지 않고 한 번의 패스로 질문과 옵션을 채점한다. 9월 18일에 업로드된 cua-s1-forms는 컴퓨터 사용(computer-use) 작업을 겨냥했으며, 독립 구현으로 옵션별 확률을 반환하고 MIT 라이선스로 배포된다. 이 모델은 2일 만에 즐겨찾기 57개를 모았고, ONNX와 CoreML 포맷의 커뮤니티 포트도 이미 등장했다. 다만 이 모델은 TypeSafe의 RLCD 기법을 적용하지 않았으며, Jev의 측정된 성능을 재현하지도 않는다.

커뮤니티 평가는 예상대로 갈렸다. 한 진영은 분류·라우팅·채점에 모델을 집중하는 게 실제로 유용하다고 본다. 이런 작업이 자동화 파이프라인의 대부분을 차지하기 때문이다. 반대 측은 판단 전용 모델과 범용 언어 모델의 비교가 단순하지 않다고 지적한다. 두 모델이 같은 것을 주고받는 게 아니라서 속도·비용 격차만으로는 우열을 단정할 수 없다는 논리다. 결국 이 카테고리가 출시 주간의 볼거리로 끝나는지, 아니면 하나의 장르로 남는지를 가를 미해점 과제는 하나다. 벤치마크 스크립트가 아니라 실제 운영 자동화에서 이 인터페이스들이 어떤 정확도와 안정성을 보여주느냐다. 시장을 실시간으로 추적하려는 독자는 MEXC에서 현물·선물 가격을 실시간으로 확인할 수 있다.

Web3를 위한 판단 레이어

COINOTAG가 공식 발표와 이후 일주일간의 후속 공개를 검토했을 때, 판단 전용 모델의 가장 자연스러운 자리는 온체인 로직이 아니라 자동화된 Web3 백엔드다. 비트코인(Bitcoin, BTC) 생태계에서 예상되는 첫 활용은 관리 업무다. 지갑 제공사의 고객 문의 분류, 분석 데스크의 거래 라벨링, 노드 모니터링의 알림 임계값 같은 곳이다. 70밀리초 만에 타입화된 답변을 돌려주는 구조가 생성된 문장보다 나은, 전형적인 분류 작업들이다. 합의 결정은 이 설계의 정의상 범위 밖이다. 오픈소스 포트가 병렬 평가 인터페이스를 유지한 채 독립 벤치마크가 쏟아진다면, 판단 레이어는 레이어3 서비스를 포함한 애플리케이션 계층의 일상적인 인프라가 될 수 있다.

COINOTAG News Desk

COINOTAG News Desk

COINOTAG의 편집 및 리서치 데스크입니다.

News Desk 운영 방식
AI 지원

이 콘텐츠는 인공지능으로 생성되어 AI 검토를 거쳤으며 COINOTAG 편집 감독 하에 게시되었습니다.