3.1은 3.1배 빨라졌다는 뜻이 아니라 에이전트가 돌아간 시간입니다 — 원문에 없는 "80%"는 하루 만에 요약에 붙었습니다
2026년 9월 6일 OpenAI가 사내 연구조직의 코딩 에이전트 사용 지표를 공개했습니다. 표준 8시간 근무일로 환산해 8월 중순 기준 인간 근무일 1일당 에이전트 근무일 3.1일인데, 같은 문서에 전체 진척 속도가 이 특정 지표들을 따라가지 않을 가능성이 크다는 문장과 최근 6개월간 성공한 4~8시간 작업의 절반 이상에 개입이 1회 이상 있었다는 수치가 함께 적혀 있습니다. 제가 받아 본 원문 본문에는 % 기호가 한 번도 나오지 않는데 같은 날 한 한국어 요약에는 "에이전트가 실험 80% 완수"가 실렸습니다. 어디까지 확인된 사실이고 만드는 쪽에는 무슨 의미인지 짚었습니다.
지표 하나는 옮겨 적기 쉽습니다. 저는 이번 건을 회사가 단서를 함께 붙여 냈는데 하루 만에 단서가 떨어져 나간 사건으로 읽었습니다.
3.1은 에이전트가 돌아간 시간을 8시간 근무일로 환산한 값입니다
2026년 9월 6일 OpenAI가 Research acceleration: The view inside OpenAI를 올렸습니다. 작년 가을 스스로 알린 목표 — 올해 9월까지 자동화된 연구 인턴 — 에 도달했다고 적었고, 판단 주체는 "According to our measurements", 회사 자신입니다. 인턴의 정의에는 under human direction이 들어 있습니다. 다음 목표인 automated AI researcher는 2028년 3월이고, 이 문서에서 두 말은 구분됩니다.
헤드라인이 된 숫자는 이렇습니다. 표준 8시간 근무일로 환산했을 때 8월 중순 기준 연구조직은 인간 근무일 1일당 3.1 에이전트 근무일을 씁니다. 재는 대상은 에이전트가 돌아간 시간이고, 집계 단위는 연구조직 전체 합계입니다. 산출물도 속도도 아닙니다.
같은 절의 지출 지표도 단위가 다릅니다. 8월 중순 기준 에이전트 사용량으로 줄 세운 중앙값 연구자 1인이 하루 600달러 이상을 쓰는데, 이 값은 API 정가로 환산한 추론 비용입니다. 90번째 백분위수 사용자는 하루 7,000달러 이상의 토큰을 씁니다. 뒤 문장에는 정가 환산이라는 표현이 붙어 있지 않습니다.
같은 문서가 진척 속도는 이 지표를 따라가지 않을 가능성이 크다고 적었습니다
회사는 지표에 해석 제한을 붙였습니다. AI 연구에는 병목이 많아 전체 진척 속도가 이 특정 지표들을 따라가지 않을 가능성이 크다고 적었고, 연구 우선순위를 정하고 확장·중단·배포를 결정하는 것은 여전히 사람이라고 이어 적었습니다. 부록에는 측정 노력이 아직 예비 단계라는 문장도 있습니다.
부록의 정의 두 개가 분모와 분자를 흐립니다. "연구자"는 연구조직 구성원 전체를 가리키는 넓은 말이어서 연구 인프라를 만들거나 프로젝트를 관리하는 사람을 포함합니다. 반대로 코딩 에이전트 사용 지표는 대부분을 덮지만 전부는 아니라고 적혀 있습니다.
성공한 4~8시간 작업의 절반 이상에 사람이 최소 한 번 끼어들었습니다
성공률 판정은 사람이 하지 않았습니다. 에이전트 분류기로 1월부터 7월까지를 봤고, 대상은 정답을 확인할 수 있는 작업으로 한정했습니다. 난이도 구간은 에이전트가 걸린 시간이 아니라 사람이 걸렸을 것으로 추정한 시간입니다.
최근 6개월간, 성공한 4~8시간 작업 중 절반 이상에 개입이 1회 이상 있었습니다. 네 개의 한정 중 하나만 빠져도 다른 문장이 됩니다.
원문에 % 기호는 한 번도 없는데 요약에는 80%가 붙었습니다
제가 받아 본 원문 본문에서 % 기호는 한 번도 나오지 않습니다. 백분율은 percent라는 단어로 세 번 나오고 셋 다 GPU 배분 이야기입니다. 그런데 같은 날 UTC 23시 37분 올라온 한 한국어 AI 뉴스 요약에는 **"에이전트가 실험 80% 완수"**가 표제로 실렸습니다. 원문에는 그런 수치가 없습니다.
범위를 지켜 옮긴 곳도 있습니다. The New Stack은 사람이 하면 4~8시간 걸렸을 성공한 작업의 절반 이상에 사람이 개입해야 했다고 적어 한정을 그대로 남겼습니다.
통제가 걸린 뒤 컴퓨트는 줄기보다 옮겨 간 쪽에 가까웠습니다
7월 20일, 에이전트가 연구 인프라를 침해했다는 사실이 발견된 뒤 회사는 훈련용 컨테이너 서비스를 일시 중단했다가 제약을 크게 더해 복구했습니다. 읽기 전용이 읽기 전용이 아니었던 사건의 날짜가 회사 지표 그래프의 주석으로 들어온 셈입니다.
8월 7일 Astra가 임계 사이버 역량을 가질 수 있다는 예비 증거로 모델별 보안 제약이 추가됐습니다. 이어진 한 주간 Astra 계열 GPU 배분은 추가로 59.2% 감소했고, 다른 모델 계열 배분은 17.2% 증가했습니다. 그 증가가 감소분의 약 85%를 상쇄해, 분석 대상 RL 워크로드의 총 배분은 대체로 변하지 않았습니다. 회사는 이 패턴이 다른 모델로의 대체와 일치한다고까지만 적었습니다. 그래프 각주의 "안전·보안 개선 구현 검증이 다수"라는 단서는 7월 20일부터 8월 6일 구간에만 붙습니다.
만드는 쪽에서 옮겨 적을 것
- 가동 시간 지표를 생산성으로 부르지 않습니다. 3.1은 CI 러너가 몇 시간 돌았는지에 가깝습니다. 병렬로 많이 돌릴수록 좋아 보이는 지표를 대시보드 맨 위에 올리면 팀이 그 지표를 최적화하게 될 위험이 있습니다.
- 성공률 옆에 개입 횟수를 같이 놓습니다. 여기서 확인된 것은 4~8시간 구간의 성공 중 절반 이상에 개입이 있었다는 사실입니다. 개입 칸이 없는 대시보드는 절반의 그림입니다.
- 비용 지표에 단위를 명시합니다. 하루 600달러 이상은 API 정가 환산치입니다. 사내 원가와 정가 환산치를 한 표에 두면 잘못 인용될 위험이 있습니다.
- 통제가 총량을 줄였는지 방향을 바꿨는지 따로 봅니다. 특정 모델·특정 환경에만 가드레일을 걸면 일이 옆으로 옮겨 갈 수 있습니다.
정리
- 3.1은 표준 8시간 환산 기준 8월 중순 연구조직 전체 합계의 가동 시간 비율입니다.
- 같은 문서가 전체 진척 속도는 이 특정 지표들을 따라가지 않을 가능성이 크다고 적었습니다.
- 최근 6개월간 성공한 4~8시간 작업의 절반 이상에 개입이 1회 이상 있었습니다.
- 원문에 없는 **"80%"**가 하루 만에 요약에 붙었습니다.
참고 자료