Saturn 테스트에서 AI가 금융 질문 57%에 오답 — Bittensor(TAO)가 주목받는 이유

Saturn이 18개 AI 모델을 시험한 결과 개인 금융 질문 57% 실패, 어려운 질문에서는 88%에 달했다. 그러나 AI 조언에 대한 신뢰는 계속 상승 중이다.

(오후 04:01 UTC)
3분 읽기
AI 요약AI
  • Saturn 테스트에서 AI 모델 18개가 개인 금융 질문의 57%에 오답.
  • 다단계 어려운 질문에서 AI 실패율이 88%로 상승.
  • 무료 AI 모델 오답률 63% vs 유료 49%, 최고 난이도에서는 93%.
  • Claude Opus 5가 최상위 성적이나 39% 답변에서 오류.
j5wc1pnr

1만 건 답변 중 57%가 오답

영국 핀테크 기업 Saturn이 개인 금융 질문에 대한 주요 AI 모델의 성능을 시험한 결과, 정답 대신 오답이나 불완전한 답변이 57%를 차지했다. 더 구체적으로, 여러 단계를 거쳐야 하는 어려운 질문에서는 실패율이 88%로 치솟았다. 실제 가계가 마주하는 유형의 질문에서 벌어진 일이다. 이번 테스트는 ChatGPT, Alphabet의 Gemini, Claude, Copilot 등이 제공하는 유료·무료 모델 18개에 121개 질문을 던지고, 일관성을 검증하기 위해 질문당 최대 5회씩 반복해 총 1만 건이 넘는 답변을 수집했다. 사실 오류가 있거나, 중요한 정보를 빠뜨리거나, 필수 경고 문구를 누락한 답변은 실패로 분류됐다. 무료 티어의 성적이 더 나빴다. 무료 모델은 63%가 실패한 반면 유료 버전은 49%에 그쳤고, 가장 어려운 질문에서는 무료 모델의 오답률이 93%에 달했다. 추론 모드의 Claude Opus 5가 최상위를 기록했지만 그마저도 39%의 답변에서 문제를 보였다. 오류 유형은 단순 계산 실수, 세법 개정 누락, 실제로는 존재하지 않는 규정을 그대로 설명하는 수준이었다. 연금 세금 관련 한 답변은 HMRC(HM Revenue and Customs)로부터 1만 7,500파운드짜리 과세 부담에 노출될 수 있는 내용이었다. Saturn의 최고경영진 Amal Jolly는 “수백만 명이 돈 관련 조언을 AI 모델에 맡기지만, 돌아오는 것은 손실로 이어질 수 있는 잘못된 답변”이라고 지적했다. 시점도 문제를 키운다. 챗봇에 돈 관련 결정을 맡기는 소비자 의존도가 빠르게 커지는 가운데, 57%라는 오답률은 실험실의 수치가 아니라 소비자 보호 문제가 됐다. COINOTAG의 판단은 명확하다. 규제된 조언 계층 없이 AI 도구에 의존하는 직접투자 성향의 암호화폐 투자자에게 이 수치는 곧바로 연결되는 리스크다.

정확도가 흔들려도 신뢰는 계속 오른다

이번 데이터에서 가장 날카로운 모순은 정확도가 바닥을 치는데도 이러한 도구에 대한 신뢰가 계속 상승한다는 점이다. 전 세계 1만 8,000명의 소비자를 조사한 EY 설문에서는 49%가 이미 저축과 투자 결정에 AI를 활용한 경험이 있다고 답했다. 영국 금융규제 당국인 FCA는 8월 발표에서 경험이 적은 투자자 5명 중 4명이 투자 도움을 AI에 요청했다고 밝혔고, 응답자의 56%는 이 도구를 신뢰한다고 답했다. 같은 질문에서 TV와 라디오를 신뢰한다는 비율은 47%였다. 더 우려되는 오해도 함께 드러났다. 응답자의 44%는 AI가 생성한 금융 정보가 규제를 받는다고 잘못 믿고 있었다. 성인 1,000명을 대상으로 한 PensionBee의 별도 설문에서는 10명 중 약 6명이 돈 관련 조언을 별도 확인 없이 곧바로 실행하겠다고 답했고, 4명 중 거의 1명은 챗봇이 자신의 재정에 대해 틀린 정보를 준 경험이 있다고 답했다. 노출 범위도 이제 데스크톱 브라우저에 머물지 않는다. Apple의 Siri부터 Android의 Gemini까지 운영체제 수준에 어시스턴트가 내장돼 있어 모든 연령대가 대상이 됐다. Jolly의 구조적 지적은 유효하다. AI 금융 조언은 규제 주변부 바깥에 놓여 있어, 인간 어드바이저에게는 주어지는 보상 청구권이 사용자에게는 없으며, 그는 FCA에 빠른 조치를 촉구했다. 시장을 실시간으로 추적하려는 독자는 Binance에서 현물·선물 가격을 실시간으로 확인할 수 있다.

Bittensor(TAO)와 신뢰 격차

COINOTAG의 독해에 따르면, Saturn 결과가 가장 크게 맞는 곳은 기계 지능으로 스스로를 차별화하는 암호화폐 분석다. 머신러닝 모델에 기여자에게 보상을 지급하는 탈중앙화 네트워크 Bittensor (TAO)는 이번 테스트가 금 방금 긁어 넘어진 신뢰 곡선 위에서 거래된다. 챗봇이 금융 질문의 57%를 실패한다는 사실을 접한 개인 투자자 집단은 폐쇄형 어시스턴트와 함께 AI 토큰 서사의 가치 평가를 낮출 수 있다. 더 깊은 문제는 검증이다. 블록체인 오라클이 존재하는 이유 자체가 신뢰할 수 없는 입력값이 자동화된 자금 흐름을 무너뜨리기 때문이며, 금융 챗봇에는 이에 상응하는 검증 장치가 없다. 모델 신뢰성이 개선되고 조언 공백이 규제로 메워지기 전까지, 탈중앙화 AI는 연산 이야기에 앞서 신뢰 이야기다.

COINOTAG News Desk

COINOTAG News Desk

COINOTAG의 편집 및 리서치 데스크입니다.

News Desk 운영 방식
AI 지원

이 콘텐츠는 인공지능으로 생성되어 AI 검토를 거쳤으며 COINOTAG 편집 감독 하에 게시되었습니다.