AI·

3점 차 1위는 그 리더보드가 2~5위라고 적어 둔 자리였습니다 — 순위 한 줄에 같이 실린 네 개의 열

2026년 9월 2일 알리바바가 Qwen3.8-Max-0902를 냈고, Code Arena WebDev 부문에서 1691점으로 전체 1위, Claude Opus 5 (Max)보다 3점 위라는 문구가 함께 돌았습니다. 이틀 뒤 같은 표를 열어 읽으면 그 리더보드 자신이 두 모델의 순위 범위를 똑같이 2~5로 적어 두었고, 점수는 1688(±18)과 1687(±8), 투표 수는 1,472 대 10,583이며 Qwen 행에는 Preliminary 표기가 붙어 있습니다. 어디까지 확인된 사실이고 만드는 쪽에는 무슨 의미인지 짚었습니다.

리더보드 순위는 한 줄로 옮겨 적기 좋고, 그래서 대개 점수만 옮겨집니다. 저는 이번 건을 "어느 모델이 더 낫다"가 아니라 반박 근거가 그 리더보드 자신의 같은 행에 적혀 있던 사건으로 읽었습니다.

발표된 문장은 "3점 위"였습니다

2026년 9월 2일 알리바바가 플래그십 모델의 새 스냅샷 Qwen3.8-Max-0902를 냈습니다. 아키텍처·가격·컨텍스트는 그대로 두고 post-training만 바꾼 업그레이드이고, 공식 모델 페이지의 alias는 qwen3.8-max-2026-09-02입니다.

발표 직후 제3자 리더보드 Code Arena의 WebDev 부문에서 이 모델이 1691점으로 전체 1위로 데뷔했다는 발표가 Arena 공식 계정과 Qwen 공식 계정에서 각각 나왔습니다. 재인용된 문구는 Claude Opus 5 (Max)보다 3점, Kimi K3 (Max)보다 17점, 직전 Qwen3.8-Max보다 22점 위라는 것이었습니다. 그 게시물 원문은 이번에 직접 확인하지 못했고, 여기 적은 것은 재인용입니다.

같은 표가 그 모델의 순위를 "2~5위"로 적고 있습니다

한 행에 같이 실린 열만 옮긴 개념도 · 모델 우열 평가가 아님 qwen3.8-max-0902 점수 1688 · 구간 +18/−18 순위 범위 2–5 투표 1,472 · Preliminary 표기 claude-opus-5-max 점수 1687 · 구간 +8/−8 순위 범위 2–5 투표 10,583 · 별도 표기 없음 두 행의 순위 범위가 2–5로 같습니다 리더보드 자신의 표기로는 순위가 구분되지 않음 기준: 2026-09-04 07:46 KST에 읽은 표의 값
한 행에 같이 실린 열만 옮긴 개념도입니다. 2026년 9월 4일 07:46 KST에 읽은 표의 값입니다.

**2026년 9월 4일 오전 7시 46분(KST)**에 같은 페이지를 받아 표를 읽으면 다른 그림이 나옵니다. 이 표는 한 행에 순위 범위·신뢰구간·투표 수·상태 표기를 함께 싣습니다.

그 표에서 qwen3.8-max-0902의 순위 범위는 2–5이고, 비교 대상인 claude-opus-5-max의 순위 범위도 2–5로 같습니다. 리더보드 자신의 표기로는 두 모델의 순위가 구분되지 않습니다. 이 범위의 계산 방법은 확인하지 못했습니다.

3점은 ±18과 ±8 안쪽입니다

읽은 시점의 점수는 qwen3.8-max-0902가 1688(+18/−18), claude-opus-5-max가 **1687(+8/−8)**입니다. 두 구간은 거의 완전히 겹칩니다. 발표된 3점도, 이 표의 1점 차도 그 폭 안쪽입니다.

같은 표의 1위는 claude-fable-5.1-max로 **1765(+23/−23)**입니다. 다만 이 모델이 9월 2일 시점에 표에 있었는지는 확인되지 않아, Qwen이 1위 자리를 내줬다고 쓸 근거는 없습니다.

그 행에는 "Preliminary" 표기가 붙어 있습니다

Arena는 qwen3.8-max-0902 행에 Preliminary 표기를 달아 뒀습니다. 이 표기를 붙이는 기준은 확인하지 못했습니다.

표에서 관찰되는 것은 표본 크기입니다. 이 행의 투표 수는 1,472로, claude-opus-5-max의 10,583의 약 7분의 1입니다. 직전 체크포인트인 qwen3.8-max도 3,222표이고 역시 Preliminary가 붙어 있습니다.

이틀 만에 점수가 3점 움직였습니다

발표 때 인용된 점수는 1691이고, 9월 4일에 읽은 값은 1688입니다. 이틀 만에 3점이 움직였습니다. "3점 차 1위"라고 했을 때의 그 3점과 같은 크기입니다. 그 변화의 원인은 확인하지 못했습니다.

매주 새 모델이 쏟아지는 상황에서 "1위"는 모델의 속성이 아니라 시점 라벨입니다.

알리바바 자신의 비교표는 다른 이야기를 합니다

알리바바가 발표한 벤치마크 점프는 큽니다. TerminalBench 3.0이 11.3에서 29.0으로, QwenSWEbench V2가 55.1에서 70.0으로 올랐습니다. 전부 알리바바 자신이 잰 값이고, 원 비교표는 직접 보지 못했습니다.

그 비교표를 요약해 전한 AlphaSignal에 따르면, 알리바바 자신의 표에서도 여덟 개 항목은 Opus 5가 앞서고 Qwen이 앞서는 것은 세 개 항목입니다. 항목 수는 그 요약을 옮긴 것입니다. "Claude Opus 5를 이겼다"는 헤드라인의 근거는 Code Arena WebDev 한 줄입니다.

만드는 쪽에서 옮겨 적을 것

  • 리더보드 한 줄에서 점수 말고 세 개 열을 더 봅니다. 신뢰구간·표본 수·상태 표기입니다. 이 세 열을 빼면, 리더보드가 같은 범위로 적어 둔 두 모델이 1위와 3위로 읽힙니다.
  • "1위"를 문서에 적을 때 읽은 날짜를 같이 적습니다. 이틀 만에 3점이 움직였습니다. 날짜 없는 순위는 곧 틀린 문장이 됩니다.
  • 표본이 7분의 1인 신규 진입 행과 안정된 행을 나란히 놓지 않습니다. 구간이 넓으면 그 상단이 1위처럼 보입니다.
  • 벤더 자체 비교표는 끝까지 읽습니다. 벤더가 자기 기준으로 자기 모델을 평가한 사건과 같은 자리입니다. 도입 검토 문서에 인용할 것은 헤드라인이 아니라 그 표 전체입니다.

정리

  • 발표된 문장은 3점 차 1위였고, 그 게시물 원문은 확인하지 못했습니다.
  • 9월 4일 07:46 KST에 읽은 표에서 두 모델의 순위 범위는 2–5로 같습니다.
  • 점수는 **1688(±18)**과 **1687(±8)**이고, 두 구간은 거의 겹칩니다.
  • 그 행에는 Preliminary 표기가 있고, 투표 수는 1,472 대 10,583입니다.
  • 점수는 이틀 만에 1691에서 1688로 움직였습니다.
  • 알리바바 자신의 비교표도 여덟 개 항목은 Opus 5가 앞선다고 AlphaSignal이 전했습니다.

참고 자료