코드보다 사업 규칙에서 막힌다 - Real-SWE의 비공개 기업 코드 평가
비공개 기업 코드의 실제 변경 과제로 평가한 Real-SWE 결과를 읽는다. pass@1의 분모, 과제별 편차, 실패 유형과 비용·실행 시간의 해석 범위를 구분한다.
TL;DR
- Real-SWE는 기업이 사용하던 비공개 코드베이스에서 가져온 작업으로 코딩 에이전트를 평가한다. 청구·세금·고객 이전처럼 여러 서비스와 사업 규칙을 함께 이해해야 하는 과제가 중심이다. 모델 단독이 아니라 각 모델과 하네스의 조합을 비교한다.
- 공개 결과에서 Fable 5.1은 38.8%, GPT-6 Astra는 33.8%, Gemini 3.8 Flash는 31.2%의 해결률을 기록했다. 이 값은 과제마다 독립 실행을 8번 한 뒤 평균한 pass@1이다. 8번 중 한 번이라도 성공하면 풀었다고 세는 pass@8과 다르다.
- 공개 분석의 10개 과제 중 6개는 모델 전체를 합친 해결률이 15% 미만이었다. 세금 관할 과제는 64회 중 2회, 분석 스트림 리듀서는 64회 모두 실패했다. 전체 순위와 개별 업무의 적합성은 구분해야 한다.
- 실패에는 요구사항 누락뿐 아니라 확인하지 않은 가정과 주변 시스템 연결 오류가 많았다. 실패 유형의 비율은 각 모델의 실패한 실행만을 분모로 한다. 실행 시간이 길거나 비용이 높다고 해결률이 높아지는 것도 아니었다.
- 공개 표본의 결과를 기업 개발 업무 전체의 자동화율로 읽을 수는 없다. 비공개 코드는 공개 데이터 오염 위험을 줄일 수 있지만 독립적인 재현과 검증에도 제약이 있다. 과제 범위·하네스·실행 조건과 검증기가 확인하는 행동을 함께 봐야 한다.
월요일부터 청구를 다시 시작해야 하는데 모든 인보이스에 세금이 빠진다. 단순히 세율을 곱하면 될 것 같지만 기업마다 수동 세율과 외부 세금 서비스, 무징수 설정이 다르고 면세 고객은 어느 설정에서나 세금이 없어야 한다. Real-SWE의 과제는 이런 기존 제품 안의 변경을 요구한다. 필요한 파일과 서비스 연결을 찾고 이미 사용 중인 사업 규칙을 지키는 것까지 작업에 포함된다.
비공개 기업 코드와 실제 변경 요청을 평가한다
Specific Labs는 실제 회사에서 라이선스를 받은 비공개 운영 코드베이스를 평가에 사용한다. 자체 규칙과 아키텍처가 있는 제품에서 청구를 수정하거나 고객을 이전하고 여러 서비스를 연결하는 과제를 만든다. 기존 사용자가 의존하는 동작을 보존하면서 필요한 부분을 바꿔야 한다. 모든 구현 세부를 프롬프트에 써 주기보다 코드와 주변 도구에서 찾아야 하는 조건을 남긴다.
대상 선정에서는 실제 이용량과 엔지니어링 조직, 운영 요구를 살폈다고 설명한다. 예로 이용자 20만 명 이상인 소비자 앱과 은행 명세서 10만 건 이상을 처리하는 금융 플랫폼, 기업용 AI 영업 플랫폼을 든다. 이런 설명은 과제의 배경을 보여주지만 전체 기업 소프트웨어를 대표하는 무작위 표본이라는 뜻은 아니다. 비공개 코드라는 사실만으로 모든 관련 패턴이 모델 학습에서 배제됐다고 독립적으로 입증된 것도 아니다.
실행은 격리된 샌드박스에서 이루어지고 과제는 Harbor 형식을 사용한다. 검증기는 채점할 때 주입되며 기존 테스트에서 아이디어를 얻거나 기존 테스트를 그대로 사용한다. 각 과제에는 필요한 서비스만 노출된다. 페이지에 AWS 에뮬레이터와 데이터베이스, 업무 도구가 함께 나열돼 있어도 모든 과제가 모든 도구를 쓰거나 실제 고객의 운영 시스템에 직접 접속한다는 뜻은 아니다.
해결률은 모델과 하네스를 함께 반영한다
공개 순위의 Fable 5.1은 Claude Code, GPT-6 Astra와 GPT-5.6 Sol은 Codex CLI를 사용했다. Gemini 3.8 Flash는 Gemini CLI, GLM 5.3은 Claude Code, Grok 4.6은 Grok Build, Muse Spark 1.3은 Muse Code, Kimi K3는 Kimi Code와 조합됐다. 모델마다 파일 탐색과 도구 사용, 실행 관리 환경이 달라질 수 있다. 따라서 이 결과를 모델 가중치만의 능력 차이로 분리해서 해석할 수는 없다.
상위 네 조합의 해결률은 Fable 5.1이 38.8%, GPT-6 Astra가 33.8%, Gemini 3.8 Flash가 31.2%, GLM 5.3이 28.8%다. Grok 4.6과 Muse Spark 1.3은 각각 23.8%, Kimi K3는 18.8%, GPT-5.6 Sol은 16.2%다. 모두 페이지에 표시된 수치다. 공개 과제별 표에서 성공 횟수를 합치면 각 조합은 80회씩 실행했고 그 결과가 표시된 해결률과 대응한다.
과제마다 독립 실행을 8번 했다는 점을 주의해서 읽어야 한다. 이 반복은 한 번 시도했을 때의 성공을 여러 번 측정하는 데 쓰이며 8번 시도한 뒤 가장 좋은 결과를 고르는 방식이 아니다. 공개 분석의 10개 과제와 모델 8개를 합치면 관찰된 실행은 640회다. 이 계산은 공개 표의 범위에 해당하며 전체 벤치마크에 존재하는 모든 과제의 수를 뜻하지 않는다.
짧은 지시 뒤에 여러 파일과 업무 규칙이 있다
Real-SWE의 지시문 길이 중앙값은 1,742자이며 기준 해법이 수정하는 파일 수 중앙값은 11개다. 비교 대상으로 제시된 FrontierCode와 DeepSWE의 파일 수 중앙값은 각각 6개다. 짧은 요청이라도 기존 제품에서 올바르게 반영하려면 여러 부분을 살펴야 한다는 설명이다. 다만 실제 수정 파일 수가 많다는 이유만으로 과제의 모든 난도가 더 높다고 단정할 수는 없다.
이 비교의 표본은 해결률 표와 완전히 같다고 가정해서는 안 된다. 페이지는 지시문 측정에 Real-SWE의 저장소 기반 샘플 과제 8개를 썼다고 명시하지만 해결률 분석에는 10개 과제를 보여준다. 다른 벤치마크의 수치도 외부의 공개 비교와 별도 과제 파일 측정에서 가져왔다. 길이와 파일 수는 설명을 돕는 지표이며 동일 조건의 직접적인 난도 실험은 아니다.
평가자는 검증기가 요구하는 행동이 지시문에 있거나 합리적으로 발견 가능해야 한다는 원칙을 둔다. 이는 숨겨진 임의의 요구를 맞히라는 시험과 구별되는 기준이다. 그러나 어디까지가 합리적으로 발견 가능한지는 구체적인 저장소와 과제 맥락을 봐야 판단할 수 있다. 샘플 접근이 신청 방식으로 제공되는 만큼 공개 페이지의 설명만으로 그 기준이 모든 과제에서 적절한지 재현 검증한 것은 아니다.
평균 순위와 개별 과제의 성패는 다르다
공개 과제 중 비교적 높은 해결률을 보인 것은 다중 리전 순회 67.2%, API 키·환경 관리 65.6%, 사용 권한 초과분 항목 처리 50.0%, 고객 식별자 이전 40.6%였다. 나머지 여섯 과제는 모두 15% 미만이다. 청구 일정 이전은 14.1%, API 토큰 사용량 계측은 12.5%, S3 저장소 측정은 10.9%, 선형화 가능한 스캔은 4.7%, 세금 관할은 3.1%, 분석 스트림 리듀서는 0.0%다. 이 과제별 비율은 모델 전체의 실행을 합친 값이다.
모델별 강점도 다르게 나타났다. 전체 순위에서는 낮은 Grok 4.6이 고객 식별자 이전에서 8회 모두 성공한 반면 Fable 5.1은 3회 성공했다. API 토큰 계측에서는 GPT-6 Astra가 5회, Fable 5.1이 1회 성공했다. 특정 업무를 맡길 모델을 고를 때 전체 평균만 보고 결정하기 어려운 이유다. 표본이 작으므로 이런 차이 역시 반복 평가 없이 일반적인 우열로 고정해서는 안 된다.
분석 스트림 리듀서는 모든 모델에서 8회씩 실패해 공개 표 전체로는 64회 중 성공이 없었다. 반대로 어떤 모델도 모든 과제를 해결한 것은 아니다. 한 조합이 잘하는 과제와 거의 못 푸는 과제가 함께 있는 분포다. 최고 해결률이 낮다는 사실과 모든 종류의 개발 작업이 동일하게 어렵다는 주장은 구분해야 한다.
세금 계산은 세율을 넣는 일보다 크다
세금 관할 과제의 전체 지시를 펼치면 여러 요구가 드러난다. 기업이 직접 세율을 정하는 경우와 구매자 목적지에 따라 외부 제공자가 계산하는 경우, 아무것도 징수하지 않는 경우를 모두 처리해야 한다. 면세 고객은 기업의 방식과 관계없이 과세하지 않아야 한다. 외부 계산에는 양쪽 주소와 가격이 정해진 항목, 상품 범주가 필요하고 기업 계정에 맞는 샌드박스·프로덕션 구분도 따라야 한다.
계산 이후의 행동도 요구에 포함된다. 외부 서비스가 주소를 거부하면 그 문제를 알리되 인보이스 발행 자체를 중단하지 않아야 한다. 발행된 인보이스에는 세율과 세액, 총액이 남고 정산 뒤에는 인보이스 번호를 기준으로 판매를 외부 기관에 기록해야 한다. 유럽 당사자 간 거래에서는 양쪽 VAT 등록정보도 표시한다. 세금이 계산된다는 단일 테스트만으로 전체 요구의 이행을 확인하기 어려운 과제다.
이 과제는 공개 실행 64회 중 2회만 통과했다. Fable 5.1과 GLM 5.3이 각각 1회 성공했고 다른 조합은 성공하지 못했다. 다만 공개 설명만으로 각 실패가 어느 세부 요구에서 발생했는지를 모두 알 수는 없다. 복잡한 요구를 예로 드는 것과 특정 실패 원인을 추정해 확정하는 것은 다르다.
실패 유형의 분모는 실패한 실행이다
페이지는 실패를 확인하지 않은 가정, 요구사항 누락, 통합 오류, 회귀, 잘못된 파일의 다섯 유형으로 나눈다. 확인하지 않은 가정은 실제 작업 공간에서 조사하지 않고 시스템을 추측한 경우다. 요구사항 누락은 지시가 요구한 행동을 빠뜨린 경우이며 통합 오류는 아이디어는 맞아도 주변 시스템에 잘못 연결한 경우다. 회귀는 기존 동작을 깨뜨리는 실패이고 잘못된 파일은 실행 중인 앱이 호출하지 않는 별도 스크립트 등에 수정 사항을 넣는 경우다.
각 비율은 전체 실행이 아니라 해당 모델의 실패한 실행을 분모로 한다. Grok 4.6의 요구사항 누락 67.2%는 실패 61회 중 41회다. Gemini 3.8 Flash의 통합 오류 49.1%는 실패 55회 중 27회이며 GPT-6 Astra의 확인하지 않은 가정 34.0%는 실패 53회 중 18회다. 이를 전체 작업의 67.2%가 요구사항을 빠뜨린다는 식으로 바꾸면 다른 통계가 된다.
이 분류는 무엇을 더 확인해야 하는지 알려 주지만 그 자체가 원인에 대한 통제 실험은 아니다. 요구사항을 놓쳤다면 더 긴 프롬프트만으로 해결될지, 가정을 확인하지 않았다면 도구나 실행 정책이 어떻게 영향을 줬는지는 별도의 검증이 필요하다. 관찰된 제출 행동의 분류와 해결책의 효과를 구분해야 한다.
더 오래, 더 비싸게 실행해도 자동으로 풀리지는 않는다
10분 미만 실행에서는 98회 중 70회가 실패해 실패율이 71.4%였고 10분 이상에서는 542회 중 398회가 실패해 73.4%였다. 두 집단 모두 실패가 많았다는 관찰이다. 어려운 과제가 더 오래 걸렸거나 실패한 에이전트가 오래 헤맸을 가능성도 있으므로 이 비교만으로 실행 시간을 줄이면 성능이 좋아진다고 결론 내릴 수는 없다. 같은 과제의 시간 예산을 바꾼 인과 실험과는 다르다.
추정 실행당 비용은 Gemini 3.8 Flash 2.50달러에서 Fable 5.1 6.96달러까지다. GPT-6 Astra는 4.67달러, GLM 5.3은 5.12달러로 표시된다. GLM의 비용이 Astra보다 높지만 공개 해결률은 더 낮으므로 비용 순서가 성능 순서를 그대로 따르지는 않는다. 이것은 한 번 실행하는 비용의 추정치이며 해결된 과제 하나당 비용이나 사람의 검토비까지 포함한 총비용은 아니다.
출력 토큰과 도구 호출, 실행 시간도 과제와 모델에 따라 달라진다. 많은 토큰을 출력했다는 사실만으로 가정을 더 잘 검증하거나 요구를 더 충실히 반영했다고 볼 수는 없다. 성능·비용을 비교할 때는 평균 자원 사용량뿐 아니라 어떤 업무에서 통과했고 어떤 방식으로 실패했는지를 함께 봐야 한다. 실제 조직의 작업 분포가 이 공개 표본과 다르면 선택도 달라질 수 있다.
공개 결과에서 확인할 수 있는 범위
페이지는 95% 신뢰구간을 표시한다고 설명한다. 그러나 공개 텍스트에서 그 구간의 계산법과 모든 수치 경계, 하네스 버전·추론 강도·시간 예산 같은 실행 설정을 충분히 확인할 수는 없었다. 순위의 작은 차이가 통계적으로 뚜렷한지나 다른 설정에서도 유지될지는 단정하지 않는다. 이 글은 공개 결과와 과제 설명을 대조한 해설이며 평가를 직접 재실행한 보고서가 아니다.
Real-SWE가 겨냥하는 차이는 정답 코드를 만드는 일과 기업의 변경을 끝내는 일 사이에 있다. 짧은 요청 뒤에 숨은 사업 규칙을 찾고 여러 서비스에 맞게 연결하며 주변 동작을 보존해야 한다. 검증기가 확인하는 행동을 통과하는 것이 이 평가의 기준이며 기업 코드의 모든 품질과 유지보수성을 별도 인간 리뷰로 보증하는 점수는 아니다. 공개 결과는 그 조건 아래에서 모델·하네스 조합들이 어디서 막혔는지를 보여준다.
참고 자료
Introducing Real-SWE — Specific Labs, 2026년 9월. 공개 순위, 10개 과제의 실행표, 펼쳐진 세금 과제 지시문, 실패 분류와 비용·평가 설정을 확인했다.
해결 횟수와 분모는 공개 표를 다시 합산해 대조했다. 모델당 80회, 과제당 64회, 공개 분석 전체 640회이며 전체 비공개 데이터셋의 크기나 기업 업무 자동화율을 뜻하지 않는다.