리더보드의 38.8%는 제가 과제별 표를 합산하니 80회 중 31회였습니다 — 원문이 따로 적어 둔 실패 런 49회와 더하면 정확히 80이 됩니다
2026년 9월 Specific Labs가 코딩 에이전트 벤치마크 Real-SWE를 공개했습니다. 제가 그 페이지의 과제별 표를 직접 합산하니 1위 Fable 5.1은 통과 31회, 2위 GPT-6 Astra는 27회였고, 원문이 실패 유형 절에 적어 둔 분모 49·53·55·57·61·61·65·67과 더하면 여덟 모델 전부 80이 됐습니다. 원문이 적은 소요시간 분할의 98회와 542회는 640으로, 28회와 144회는 172로 맞아떨어졌습니다. 어디까지 확인된 사실이고 만드는 쪽에는 무슨 의미인지 짚었습니다.
순위표는 퍼센트만 보고 넘기기 쉽습니다. 저는 이번 건을 퍼센트의 분모를 직접 세어 볼 수 있는 사건으로 읽었습니다.
퍼센트는 제가 세어 보니 전부 80분의 몇이었습니다
Specific Labs가 코딩 에이전트 리더보드 Real-SWE를 공개했습니다(withspecific.com/benchmarks/real-swe, 제가 읽은 시각 2026-09-14T22:51Z). 1위는 Fable 5.1 · Claude Code 38.8%, 2위는 GPT-6 Astra · Codex CLI **33.8%**이고, 본문에 Each task had 8 rollouts per model.이 적혀 있습니다.
과제는 10개입니다. 제가 과제별 표의 n / 8 값을 모델마다 세로로 더하니 1위 Fable 5.1은 31, 2위 GPT-6 Astra는 27, 최하위 GPT-5.6 Sol은 13이었고, 여덟 값 모두 80으로 나눈 결과가 게시된 퍼센트와 같았습니다. 다만 80이라는 총계는 원문에 없습니다. 과제 10개와 롤아웃 8회를 곱해 제가 만든 분모입니다.
원문이 적어 둔 실패 런 분모와 더하면 전부 80이 됩니다
실패 유형 절에는 모델마다 … of N failed runs가 붙어 있고, 리더보드 순서대로 49 · 53 · 55 · 57 · 61 · 61 · 65 · 67입니다. 이 여덟 값은 원문의 것입니다. 제가 센 통과 수와 더하니 여덟 모델 전부 80이었습니다.
소요시간 분할도 같은 곳을 가리킵니다. 원문에 10분 미만이 out of 98 rollouts에 통과 28회, 10분 이상이 out of 542 rollouts에 통과 144회로 적혀 있습니다. 98과 542를 더하면 640, 28과 144를 더하면 172로 제가 센 통과 총합과 같습니다.
5%p 차이는 롤아웃 4회이고, 반올림 규칙은 적혀 있지 않습니다
1위와 2위의 5%p 차이는 제 카운트로 31회와 27회, 롤아웃 4회 차이입니다. 공동 5위 두 모델은 똑같이 19회이고, 7위와 8위는 2회 차이입니다. 같은 행의 다른 열이 순위를 뒤집던 건과 달리, 여기서는 분모 쪽에서 표본 크기가 드러납니다.
반올림은 방향이 갈립니다. 제 계산으로 33.750과 23.750은 33.8·23.8로 올라갔는데, 31.250과 16.250은 31.2·16.2로 내려갔습니다. 규칙은 이 페이지에 적혀 있지 않아 확인하지 못했습니다.
비용은 전부 Estimated이고, 두 값에는 하한이라는 단서가 붙어 있습니다
소제목은 Estimated rollout costs range from $2.50 to $6.96입니다. 가장 비싼 Fable 5.1 $6.96이 1위, 가장 싼 Gemini 3.8 Flash $2.50이 3위이고, 두 조합의 차이는 제 카운트로 통과 6회(31회 대 25회)입니다. Grok 4.6과 Kimi K3 두 값에만 incomplete usage, actual cost may be higher가 붙어 있어, 이 둘은 다른 값과 같은 정밀도로 비교할 수 없습니다.
열 머리글에는 Harness가 따로 있고, 원문은 evaluating model-and-harness combinations rather than models in isolation이라고 적었습니다. 하네스가 갈리면 점수가 갈리던 건이 표의 열로 들어온 셈입니다. 다만 native harnesses라고 적어 놓고 GLM 5.3의 하네스는 Claude Code입니다. 이유는 이 페이지에 없어 확인하지 못했습니다.
제가 확인하지 못한 것
캡션은 95% confidence intervals are shown.이라고 적었지만, 제가 받은 HTML에서는 신뢰구간 수치를 찾지 못했습니다. 게시 시각도 이 페이지에는 <h1> 바로 위 September 2026 한 줄뿐이고 datePublished·article:published_time·<time이 각각 0건이라, Hacker News 공개 API의 제출 시각 2026-09-12T20:25:48.000Z을 근거로 늦어도 그 시각에는 공개돼 있었다까지만 적습니다. 실제 기업의 토큰 중 **99%**가 프런티어 모델로부터 감춰져 있다는 본문 문장에는 출처가 없습니다. 과제와 코드베이스는 request access 안내만 있어 저도 열지 못했습니다.
만드는 쪽에서 옮겨 적을 것
- 퍼센트를 비교하기 전에 분모를 찾습니다. 5%p가 롤아웃 4회라면 도구 선택의 근거가 달라집니다.
- 실패율은 분모가 무엇인지부터 확인합니다. 원문은
Percentages are out of each model's failed runs, not all runs.라고 적었습니다. 전체 런 기준으로 읽으면 해석이 뒤집힙니다. - 검산 가능과 재현 가능은 다릅니다. 과제별 표와 집계값은 독자가 검산할 수 있습니다. 다만 과제·코드베이스는 접근 요청 안내만 있어, 공개 페이지만으로는 같은 실험을 다시 돌려 볼 수 없습니다.
정리
- 제가 과제별 표를 합산하니 게시된 여덟 퍼센트가 전부 80분의 몇이었고,
80은 원문에 없는 제 계산값입니다. - 원문이 적은 실패 런 분모, 그리고 640·172가 제 카운트와 전부 맞았습니다.
- 신뢰구간 수치와 정확한 게시 시각은 확인하지 못했습니다.
참고 자료