큐원3.8 맥스, 에이전틱 지표 정상에
독립 벤치마크 종합 최상위 집계… 평가 체계도 v4.1.1로 갱신됐다
독립 평가기관 아티피셜 애널리시스(Artificial Analysis)의 에이전틱 인덱스에서 큐원3.8 맥스(Qwen3.8 Max)가 종합 최상위로 집계됐다. 이 모델은 8월 5일 신규 평가 대상으로 등재됐고, 하루 뒤인 8월 6일에는 순위의 근거가 되는 인텔리전스 인덱스(Intelligence Index)가 v4.1.1로 갱신됐다. 선두가 바뀐 것과 점수를 재는 자가 바뀐 것이 같은 주에 겹쳤다는 점이 이번 소식의 진짜 무게중심이다.
무슨 일인가 / 배경
아티피셜 애널리시스는 모델을 만드는 쪽이 아니라 제3자 입장에서 지능·속도·비용을 측정해 공개하는 곳이다. 현재 추적 대상은 595개 모델에 이르고, 비교 화면에는 그중 26개를 골라 올리는 방식이다. 큐원3.8 맥스의 평가 등재는 8월 5일 변경 기록에 남아 있고, 같은 주에는 링 3.0 타이니(Ling 3.0 Tiny)와 뮤즈 스파크 1.2(Muse Spark 1.2) 등 신규 평가가 줄줄이 올라왔다.
선두 교체 자체는 새삼스러운 일이 아니다. 7월 31일에는 딥시크 V4 플래시 0731(DeepSeek V4 Flash 0731)이 인덱스 50점을 기록하며 직전 버전보다 10점을 끌어올렸고, 7월 24일에는 클로드 오퍼스 5(Claude Opus 5)가 에이전틱 지식노동 부문 선두로 소개됐다. 몇 주 간격으로 1위 자리가 옮겨 다니는 국면이다.
핵심 짚어보기
새 인덱스 v4.1.1은 아홉 개 평가를 묶어 하나의 점수로 만든다. GDPval-AA v2, 타우3-뱅킹, 터미널벤치 v2.1(Terminal-Bench v2.1), 사이코드(SciCode), 인류 최후의 시험(Humanity's Last Exam), GPQA 다이아몬드, 크릿PT(CritPt), AA-옴니사이언스, AA-LCR이다. 이번 갱신에서는 타우3-뱅킹이 v1.0.1로 올라갔고, 세 개 평가의 채점 모델이 GPT-5.6 루나(medium)로 교체됐다. 채점기를 바꿨다는 것은 같은 모델도 점수가 달라질 수 있다는 뜻이라, 지난달 표와 이번 달 표를 그대로 겹쳐 읽으면 안 된다.
실무자가 볼 지표는 순위 자체보다 옆에 붙은 작업당 비용(Cost per Task)이다. 입력·캐시 적중·캐시 기록·추론·응답 토큰 가격을 각각 계산해 과제 하나를 푸는 데 실제로 든 지출로 환산한 값이다. 8월 4일 공개된 엔드포인트 정확도 인덱스(Endpoint Accuracy Index)도 결이 같다. 이름이 같은 모델이라도 어느 제공사 엔드포인트로 부르느냐에 따라 품질이 달라진다는 것을 측정하겠다는 시도다.
1인기업 실전 적용 포인트
- 자동화 파이프라인의 모델은 이름이 아니라 작업당 비용으로 고른다. 매일 도는 뉴스 요약·보고서 생성처럼 호출 수가 고정된 잡이라면, 상위 세 모델의 작업당 비용 차이에 월 실행 횟수를 곱해보면 교체 여부가 바로 나온다.
- 1위 모델로 전부 갈아타지 말고 단계를 쪼갠다. 분류·태깅·중복 제거처럼 판단이 단순한 구간은 저비용 모델에, 최종 한국어 원고만 상위 모델에 맡기는 2단 구성이 비용 절감 폭이 가장 크다.
- 인덱스 버전이 오르면 내 고정 프롬프트도 한 번 재평가한다. 이전 채점 기준에 맞춰 다듬어 둔 프롬프트가 새 기준에서는 손해를 볼 수 있다.
- 호출 경로를 로그에 남긴다. 어느 제공사·어느 엔드포인트로 불렀는지 기록해야, 품질이 흔들릴 때 원인을 모델 탓과 경로 탓으로 갈라낼 수 있다.
전망 / 주의점
지금 속도라면 상위권은 몇 주 안에 또 바뀔 가능성이 크다. 그래서 1인기업이 붙잡아야 할 것은 1위 모델이 아니라 모델을 갈아끼우기 쉬운 구조다. 모델명을 코드 곳곳에 박아두지 말고 설정 한 곳에서 바꾸도록 해두면 순위표가 흔들려도 반나절이면 따라갈 수 있다.
반대로 순위표를 과신하는 것도 위험하다. 벤치마크 과제는 내 실제 업무와 다르고, 한국어 표현력이나 긴 문서를 놓치지 않고 끌고 가는 능력은 지표 몇 개로 환원되지 않는다. 최종 판단은 내가 실제로 굴리는 작업 10건을 두 모델에 똑같이 넣어보는 자체 테스트여야 한다.
출처: 아티피셜 애널리시스 (https://artificialanalysis.ai/?intelligence=agentic-index)