월말 결산 과제 정확도, 회계사 평균 37%, AI 100%: 이 결과를 읽을 때 확인할 것
"AI가 회계사보다 정확했다"는 문장은 회의 자료에 넣기 좋습니다. 숫자도 분명합니다. 공인회계사 평균 약 37%, AI 100%. 그런데 이 숫자를 근거로 우리 회사 업무를 AI에 맡길지 정하려면, 실험이 어떤 조건에서 무엇을 평가했는지부터 확인해야 합니다.
실험의 내용
AI 평가 회사 Mercor는 10월 1일(현지시간) 회계 업무에서 사람과 AI 모델을 비교한 결과를 공개했습니다. 평균 경력 5년 반의 공인회계사 12명에게, 자사 회계 벤치마크(APEX-Accounting) 과제를 단순화한 월말 결산 시나리오를 맡겼습니다. 회사 업무 파일을 뒤져 맞는 숫자를 찾고, 계산해서 결과표를 내는 과제였습니다.
회계사들은 AI 없이 과제마다 30분에서 180분을 썼고, 점수는 0%에서 90%까지 갈렸습니다. Claude Opus 5는 20번 시도에서 모두 100%를 받았고, 한 번에 10분이 걸리지 않았다고 합니다.
(Mercor는 AI 기업에 전문가 데이터와 평가를 제공하는 회사라, AI가 사람을 앞선다는 결과를 보여 줄 이유가 있는 발표 주체입니다. 다만 연구진이 한계를 스스로 자세히 적었다는 점은 참고할 만합니다.)
연구진이 스스로 밝힌 한계
이 발표에서 눈여겨볼 대목은 결과보다 한계를 적은 부분입니다. 연구진은 과제가 모델이 가장 잘하는 기술, 즉 세부 사항을 꼼꼼히 보고 파일을 뒤지고 지시를 정확히 따르는 일만 평가했다고 썼습니다. 평가하지 않은 능력도 밝혔습니다.
we did not measure the skills likely to matter more as models take on the structured, detail-oriented parts of accounting: client communication, asking the right questions, building tacit context.
고객과 소통하고, 맞는 질문을 던지고, 문서에 없는 맥락을 쌓는 일은 측정 범위 밖이었다는 뜻입니다. 실제 회계 업무에서 시간이 많이 드는 부분이 바로 이쪽입니다.
이런 수치를 볼 때 확인할 것
과제를 만든 곳
평가하는 곳이 과제를 만들면 정답도 그곳이 정합니다. 이번 실험도 Mercor가 자사 벤치마크를 단순화해 만든 과제였습니다. 우리 회사 회계팀이 매달 하는 결산과 얼마나 닮았는지는 따로 따져 봐야 합니다.
실험에서 빠진 조건
조건이 깔끔할수록 AI에 유리합니다. 이번 과제는 필요한 파일이 모두 주어졌고, 무엇을 내야 하는지도 정해져 있었습니다. 현장에서는 파일이 빠져 있거나, 숫자가 서로 맞지 않거나, 누구에게 물어봐야 할지부터 찾아야 하는 경우가 흔합니다.
우리 회사 데이터와의 차이
공개 벤치마크 점수가 높아도 우리 회사 문서와 용어로 같은 결과가 나온다는 보장은 없습니다. 부서마다 다른 계정 이름이나 개정 전 기준이 섞인 문서가 있으면 정확도가 떨어집니다. 이 문제는 RAG 운영 글에서 따로 다뤘습니다.
하이퍼이지가 실증에서 성과를 확인하는 방식
하이퍼이지가 고객사와 실증을 할 때 먼저 정하는 것은 정답지입니다. Ground Truth라고 부르는데, 그 업무를 맡아 온 현업 담당자가 "이 질문에는 이 답이 맞다"고 합의한 기준입니다. 2월에 쓴 Ground Truth와 온톨로지 글에서 이 개념을 설명했습니다.
정답지를 하이퍼이지가 만들지 않고 현업이 만들게 하는 이유는 이번 실험의 한계와 같은 맥락입니다. 평가하는 곳이 문제를 고르면 잘 풀리는 문제만 고르기 쉽습니다. 현업이 만든 질문에는 예외 처리, 문서에 없는 규칙, 부서 사이의 확인처럼 AI가 약한 부분이 자연스럽게 섞입니다. 데이터도 데모용으로 정리한 자료 대신 고객사가 실제로 쓰는 문서와 시스템 데이터를 씁니다.
그러다 보니 점수가 공개 벤치마크와 다르게 나오는 경우가 생기는데, 그 차이가 어디서 생겼는지 따라가 보는 일이 실증에서 가장 쓸모 있는 결과가 됩니다. 어떤 질문에서 틀렸는지 보면, 모델을 바꿔야 할지, 문서를 정리해야 할지, 사람이 확인하는 단계를 둬야 할지가 정해지기 때문입니다.
"AI가 사람보다 정확했다"는 수치가 틀린 말은 아닙니다. 다만 어떤 과제에서, 누가 만든 정답으로, 무엇을 빼고 평가했는지까지 함께 읽어야 우리 업무에 맞는 결정을 내릴 수 있습니다.