모델은 같고 하네스만 바꿨는데 44점이 올랐다 - 여섯 계층으로 정리한 프로덕션 하네스
엔터프라이즈 AI 에이전트의 95%가 프로덕션에 도달하지 못한다는 진단에서 출발해, 그 격차를 하네스 엔지니어링으로 규정한다. 가이드·센서·에이전틱 루프·메모리·권한·관측성 여섯 계층과 7일 구축 경로, 실패를 영구 인프라로 바꾸는 래칫 원리를 정리한다.
모델은 같고 하네스만 바꿨는데 44점이 올랐다
TL;DR
- 문제 진단이 수치로 시작하는데 엔터프라이즈 AI 에이전트의 95%가 프로덕션에 도달하지 못한다는 것이다. 실패 양상이 구체적이다. 데모는 잘 되고 예산 검토도 통과한 다음 프리프로덕션에서 조용히 죽는데, 그 격차의 이름이 하네스 엔지니어링이다.
- 공식이 Agent = Model + Harness이고 역할 분담이 명확하다. 모델이 추론을 제공하고 하네스가 나머지 전부를 제공한다. 그 나머지가 알려진 실패를 막는 가이드, 새 실패를 잡는 센서, 재시도가 제한된 에이전틱 루프, 지속 메모리, 강제되는 권한, 완전한 관측성이다.
- 근거가 가장 강력한 부분인데 같은 Claude Sonnet 4.5가 GAIA에서 30.91%에서 74.55%로 움직였고 43.64점 차이가 전적으로 하네스에 귀속된다. 다른 사례로 모델 변경 없이 Terminal Bench 30위에서 5위로, 그리고 수동으로 쓴 코드 0줄로 100만 줄 코드베이스가 붙는다.
- 방법론의 핵심이 래칫 원리이고 Hashimoto의 문장이 인용된다. 에이전트가 실수하는 것을 발견할 때마다, 그 에이전트가 다시는 그 실수를 하지 않도록 해법을 공학적으로 만드는 시간을 들인다. 층위별 강도도 구분되는데 프롬프트 패치는 한 대화를 고치고 가이드 규칙은 모든 미래 실행을 고친다.
- 하네스를 만들지 말아야 할 때도 명시되는데 단발 질문, 창의적 브레인스토밍, 탐색적 대화, 일회성 과제는 가이드나 센서, 체크포인트에서 이득을 보지 못한다. 판별 질문은 에이전트가 조용히 틀린 결과를 냈을 때 알아차리겠는가다.
Source
Source: Harness Engineering - Agent = Model + Harness, The 6-Layer Production Playbook — 독립 편찬 기술 노트, 2026-08
Knowledge
데모는 되는데 출하되지 않는다
문서는 문제를 수치로 규정하면서 시작한다. 엔터프라이즈 AI 에이전트의 95%가 프로덕션에 도달하지 못한다. 그런데 실패 지점이 예상과 다르다. 데모는 잘 되고 예산 검토를 통과한 다음 프리프로덕션에서 조용히 죽는다.
죽는 이유가 열거되는데 이 목록이 격차의 성격을 보여 준다. 보안 검토를 통과하지 못하고 관측성 요구사항을 놓치고 엣지 케이스에서 환각하고 모든 엔터프라이즈가 필요로 하는 통치를 갖추지 못한다.
챗봇과 에이전트의 차이도 규정된다. 챗봇은 응답을 생산하고 에이전트는 결과를 생산한다. 그리고 차이의 위치가 지목되는데 이 문장이 문서 전체의 논지다. 차이는 모델이 아니다. 차이는 확률적 언어 모델을 신뢰할 수 있고 제한되고 관측 가능한 시스템으로 바꾸는 인프라다.
현재 상황도 진단된다. 이제 모든 AI 코딩 도구가 코드를 생성한다. 그런데 결과가 다르다. 더 많은 코드가 더 나은 코드를 뜻하지는 않는다. 근거로 조사가 인용되는데 관찰이 구체적이다. AI 도입이 이전보다 더 크고 더 복잡하고 더 넓은 폭발 반경을 가진 변경을 만들어 내고 있다. 그리고 탐지 비용이 지목된다. AI가 생성한 산출물의 설득력 있는 표면 품질이 오류를 인지적으로 비싸게 만든다.
세 시대와 각각의 한계
문서가 학문 분야의 진화를 세 시대로 정리한다. 업계는 2023~2024년을 프롬프트 최적화에 썼는데 표현, 예시, 사고 연쇄였다. 다음 시대가 다르다. 2025년은 맥락 시스템 설계에 썼고 RAG, MCP, 메모리, 검색이었다. 그리고 전환 시점이 특정된다. 2026년 2월까지 실무자들이 앞의 둘을 포섭하는 세 번째 학문 분야로 수렴했다.
각 시대의 최적화 대상과 한계가 대비된다. 프롬프트 공학은 단일 턴을 다뤄 한 번의 상호작용이 한계였고 맥락 공학은 모델이 보는 것을 다뤘고 하네스 공학은 전체 런타임을 다룬다.
포섭 관계가 명시되는데 이 구분이 유용하다. 하네스는 맥락 파이프라인과 프롬프트를 포함하지만 검증과 권한, 관측성, 상태 지속성도 포함한다. 그리고 세 문장으로 압축된다. 프롬프트 공학은 모델이 말하는 것을 형성한다. 맥락 공학은 모델이 보는 것을 형성한다. 하네스 공학은 모델이 할 수 있는 것, 실패에서 살아남는 것, 일어나도록 허용된 것, 성공적 완료를 구성하는 것을 형성한다.
공식과 그 증거
공식이 어떻게 정립됐는지가 날짜와 함께 서술된다. 2026년 2월 5일 HashiCorp 공동창업자이자 Terraform과 Vagrant, Ghostty의 창작자인 Mitchell Hashimoto가 내 AI 도입 여정이라는 제목의 글을 올렸다.
거기서 인용된 방법론이 이 문서 전체의 방법론적 뼈대가 된다. 에이전트가 실수하는 것을 발견할 때마다, 그 에이전트가 다시는 그 실수를 하지 않도록 해법을 공학적으로 만드는 시간을 들인다.
며칠 뒤 사례가 붙는다. OpenAI 엔지니어의 현장 보고인데 규모가 압도적이다. 팀이 다섯 달을 들여 수동으로 쓴 코드가 0줄인 프로덕션 제품을 만들었고 코드베이스가 약 1,500개의 자동화된 풀 리퀘스트로 100만 줄에 도달했다. 사람의 역할이 규정된다. 사람들은 코드를 쓰고 있지 않았다. 신뢰할 수 있는 코드 생성을 가능하게 하는 환경을 설계하고 있었다. 표어도 인용된다. 사람은 조종하고 에이전트는 만든다.
증거표에서 가장 강한 것이 GAIA 결과다. 조건이 명확하다. 모델을 고정하고 하네스만 교체한다. 결과가 이렇다. 같은 Claude Sonnet 4.5가 GAIA에서 30.91%에서 74.55%로 움직이는데, 43.64점 차이가 전적으로 하네스에 귀속된다. 그리고 비교가 붙는데 이 대비가 논지를 완성한다. 이것은 대부분의 모델 업그레이드가 제공하는 것보다 크다.
다른 사례들도 같은 구조다. 같은 모델로 Terminal Bench 30위에서 5위로 25등 상승, 16개 LLM에서 하네스만 바꿔 개선, Codex 에이전트로 0줄에서 100만 줄.
내부 하네스와 외부 하네스 구분도 실무적으로 중요하다. 프런티어 AI 연구소가 내부 하네스를 만드는데 기반 안전 계층과 네이티브 도구 호출, 기본 모델에 내장된 맥락 창이다. 그런데 제품 팀의 자리는 다르다. 제품 팀의 공학적 방어선은 외부 하네스인데, 모델 주변에 팀이 만드는 맞춤 설정과 환경 라우팅, 테스트 프레임워크, 상황별 지침이다.
계층 1과 2, 가이드와 센서
여섯 계층 중 앞의 둘이 조종 루프를 만든다. 용어의 출처도 밝혀지는데 Martin Fowler와 Birgitta Böckeler가 하네스 구성 요소의 표준 어휘가 된 가이드와 센서 분류를 도입했다.
가이드가 피드포워드 통제다. 정의가 명확하다. 에이전트가 작업을 시작하기 전에 읽는 지시이며 실행 전에 행동을 형성한다. 파일 형태도 열거된다. AGENTS.md, CLAUDE.md, .cursorrules. 그리고 각 줄의 성격이 규정되는데 이 표현이 래칫 원리와 이어진다. 각 줄은 영구적 예방 기제로 전환된 과거의 실패를 표상한다.
가이드의 내용에 대한 요구가 구체적이다. 실행 가능한 행동과 관찰 가능한 기준을 담아야 하고 동기 부여 언어가 아니다. 예시가 대비로 제시된다. 철저히 조사하라를 명명된 출처와 중단 규칙, 인용 요구사항으로 바꾸라. 좋은 코드를 쓰라를 린터 명령과 테스트 명령, 구체적 패턴으로 바꾸라.
가이드 위생도 별도로 다뤄지는데 이 경고가 실무적이다. 가이드는 누적된다. 유지관리 없이는 모순되거나 중복되거나 낡는다. 그래서 요구가 나온다. 가이드 파일을 버전 관리하고 매달 검토하라. 센서가 이제 자동으로 강제하는 규칙을 제거하라. 각 항목에 날짜를 붙여 언제 왜 추가됐는지 추적할 수 있게 하라. 판정이 짧다. 날짜 없는 200줄의 가이드 파일은 하네스가 아니다. 기술 부채다.
가이드가 조직 기억이라는 관점도 제시된다. 가이드 파일은 에이전트만을 위한 것이 아니다. 기능이 규정된다. 시스템이 어떻게 작동하는지, 무엇이 전에 실패했는지, 무엇이 절대 일어나서는 안 되는지에 대한 부호화된 지식이다. 인상적인 효과도 언급된다. 엔지니어가 떠날 때 그의 교정은 가이드 파일 안에 살아남는다.
권위 관계가 반전되는 대목이 특히 눈에 띈다. 가이드와 대화가 충돌하면 가이드가 이긴다. 그리고 이유가 명시된다. 파일에 대화보다 더 많은 권위를 주는 이 반전이 하네스를 지속 가능하게 만드는 것이다.
센서가 피드백 통제다. 실행 후에 산출물을 검증하며 가이드가 막을 수 없었던 문제를 탐지한다. 두 종류로 나뉘는데 성격이 확연히 다르다. 계산적 센서는 린터와 타입 검사기, 단위 테스트, 스키마 검증기이고 빠르고 무료이며 결정적이다. 반대쪽이 추론적 센서로 LLM 판사와 AI 코드 리뷰이며 느리고 비싸고 비결정적이다.
설계 원칙이 순서를 정한다. 계산적 센서 먼저. 결정적 규칙으로 표현할 수 없는 검사에만 추론적 센서를 추가하라.
경제성 논거가 구체적이다. 하루 50번 실행되는 과제에 실행당 10달러짜리 LLM 판사는 하루 500달러다. 대비가 붙는다. 같은 종류의 오류를 잡는 린터는 무료다.
추론적 센서를 언제 추가할지도 규정된다. 어떤 결정적 규칙도 담을 수 없는 의미 이해가 필요할 때만이고 예시가 열거된다. 고객 이메일의 어조, 법률 요약의 정확성, 설계 결정의 품질. 그런데 취급 방식이 제한된다. 비싼 조언 신호로 다루고 게이트로 다루지 말라. 그리고 대체 경로도 제시된다. 패턴이 규칙으로 부호화할 만큼 분명해지면 결정적 검사로 바꾸라.
자기 검증 패턴이 가장 강한 패턴으로 제시된다. 가장 강한 하네스 패턴은 에이전트에게 자기 센서에 대한 접근을 준다. 그런데 성격이 명확히 구분된다. 이것은 모델이 자기 품질을 판단하는 것이 아니다. 모델이 외부의 결정적 검사를 실행하고 그 결과에 따라 행동하는 것이다.
계층 3, 제한된 에이전틱 루프
루프의 성격이 먼저 규정된다. 하네스 중심에 있는 실행 엔진이며 단일 모델 호출이 아니다. 주기가 열거된다. 행동을 계획하고 도구로 실행하고 센서로 결과를 검증하고 실패를 고치고 진행하거나 에스컬레이션한다. 그리고 조건이 붙는다. 모든 단계가 관측 가능하고 모든 재시도가 계수된다.
필수 경계가 표로 제시되는데 기본값이 함께 있어 그대로 쓸 만하다. 단계당 최대 재시도 3회, 최대 실행 시간 30분, 최대 토큰 예산 10만, 최대 금전 비용 과제당 5달러, 최대 도구 호출 50회. 마지막 항목이 성격이 다르다. 중단 조건은 항상 정의되어야 한다.
예산이 소진됐을 때의 동작이 명시되는데 이 요구가 중요하다. 현재 최선의 산출물과 완료된 작업, 해결되지 않은 문제, 중단 이유를 반환한다. 금지도 명확하다. 유창한 최종 답변 뒤에 부분적 실패를 숨겨서는 안 된다.
에스컬레이션에 대한 태도가 이 문서에서 가장 인상적이다. 올바르게 에스컬레이션하는 에이전트가 확신에 찬 틀린 답을 내놓는 에이전트보다 값어치 있다. 에스컬레이션 꾸러미의 내용도 규정된다. 사람에게 필요한 결정, 권장 선택지, 이미 시험한 대안, 기다리는 비용, 응답이 오지 않을 때의 가장 안전한 기본 행동.
배경 에이전트 규칙도 인용된다. 나는 항상 에이전트가 뭔가를 하고 있도록 노력한다. 내가 코딩하고 있으면 에이전트가 계획하기를 원하고 에이전트가 코딩하고 있으면 내가 검토하고 있기를 원한다. 그리고 사람의 자리가 규정된다. 사람은 의도를 제공하고 결과를 검토하고 에스컬레이션을 처리한다. 그 순간들 사이의 모든 것이 하네스다.
계층 4와 5, 메모리와 권한
메모리 계층의 전제가 명확하다. 모든 모델 호출은 빈 맥락 창으로 시작한다. 그래서 비대칭이 규정된다. 모델은 지속적 기억이 없다. 하네스가 명시적 상태 관리를 통해 연속성을 제공한다.
가장 실용적인 조언이 파일시스템이다. 가장 단순한 지속 메모리는 파일시스템이다. 형태가 구체적이다. plan.md 파일, decisions.md 로그, progress.json 체크포인트. 그리고 평가가 붙는데 이 판정이 도구 선택을 단순하게 만든다. 대부분 에이전트 워크플로에서 벡터 데이터베이스보다 더 값싸고 단순하고 신뢰할 수 있다.
장시간 실행에서의 압축도 다뤄진다. 오래된 맥락을 요약하고 최근 행동과 결정을 보존하며 작업 집합을 맥락 예산 안에 유지하는 것. 그리고 책임 소재가 구분되는데 이 구분이 중요하다. 압축 자체는 모델 호출이지만 언제 무엇을 압축할지 결정하는 것은 에이전트가 아니라 하네스에 속한다.
메모리와 가이드의 구분도 명확하다. 메모리는 무엇이 일어났는지 기록하고 가이드는 무엇이 일어나야 하는지 정의한다. 그래서 승격 규칙이 나온다. 규칙이 모든 미래 실행에 중요할 때 에이전트가 오래된 대화의 교정 하나를 기억하는 데 의존하지 말라. 안정적인 선호와 정책, 절차를 명시적 가이드 파일로 승격하라.
복구 시험이 검증 방법으로 제시되는데 즉시 실행 가능하다. 다단계 과제 중간에 세션을 닫고 다시 열어라. 기대 동작이 명시된다. 체크포인트를 읽고 마지막 완료 단계를 식별하고 다음 단계부터 재개해야 하며 완료된 작업을 반복하거나 사람에게 과제를 다시 설명하게 하지 않아야 한다.
권한 계층의 전제가 강하다. 모델은 스스로를 제한할 수 없다. 행동이 예고된다. 접근 가능한 어떤 도구든 쓰고 닿을 수 있는 어떤 파일에든 쓰고 작성할 수 있는 어떤 메시지든 보낸다. 그래서 소재가 규정된다. 권한은 모델의 속성이 아니라 하네스의 속성이며 하네스가 주된 보안 경계다.
기본 행동 정책이 표로 제시되는데 되돌릴 수 있는지가 기준이다. 소스 파일 읽기는 허용이고 되돌릴 수 있는 관찰이며 프로젝트 파일 쓰기는 허용하고 기록하는데 깃으로 복구 가능하다. 반대쪽이 다르다. 프로덕션 배포는 사람만 하는데 되돌리기 어렵고, 데이터나 파일 삭제도 사람만 하는데 잠재적으로 되돌릴 수 없다.
프롬프트 주입이 위험 모델을 바꾼다는 지적이 별도로 다뤄진다. 자율 에이전트는 이메일과 웹페이지, 문서, 저장소 이슈, 사용자 제출 텍스트 같은 신뢰할 수 없는 내용을 읽는다. 그래서 요구가 명확하다. 내용에 심긴 악성 지시가 에이전트의 권한을 확장하거나 시스템 정책을 바꾸거나 비밀을 다른 곳으로 돌리거나 외부 행동을 촉발해서는 안 된다. 구조적 대응도 제시된다. 모든 과제에서 신뢰된 지시와 신뢰할 수 없는 데이터를 분리해야 한다.
네 가지 예산 차원도 정리된다. 범위는 어떤 계정과 도구, 파일, 작업이 가능한지이고 속도는 구간당 최대 쓰기와 커밋, 외부 호출이며 되돌림 가능성은 안전하게 롤백할 수 있는지이고 가시성은 누가 통보받고 어떤 증거가 감사용으로 보존되는지다. 시점도 명시된다. 첫 무인 실행 전에 넷 모두를 부호화하라.
계층 6, 관측성
관측성의 필요가 실패 양상으로 설명된다. 관측성 없이는 더 빠른 에이전트가 중요했던 작업을 조용히 빠뜨리면서 성공적으로 보일 수 있다.
필수 텔레메트리가 열거된다. 시작과 종료 시각, 도구 행동과 결과, 가이드 버전과 사용된 센서, 시도 횟수와 비용, 생산된 산출물, 승인과 에스컬레이션.
트립 와이어가 표로 제시되는데 기준과 대응이 짝지어져 있어 그대로 설정할 수 있다. 외부 쓰기 급증은 권한 이탈을 뜻하고 쓰기를 동결한다. 같은 오류가 3회 반복되면 가이드나 센서 공백이고 에스컬레이션한다. 비용이 평균의 2배를 넘으면 폭주 루프이고 멈추고 점검한다. 센서 통과율이 떨어지면 품질 회귀이고 롤백한다.
건강 점수표의 방향도 명확하다. 완료율은 올라가야 하고 재작업률과 에스컬레이션률, 복구 시간, 과제당 비용은 내려가야 한다. 마지막 항목이 특히 흥미롭다. 가이드 증가는 감소해야 한다.
비용 귀속에 대한 지적이 실용적이다. 하루가 아니라 과제당 비용을 추적하라. 이유가 명확하다. 하루 50달러 지출은 100개 과제를 완료했는지 2개를 완료했는지 모르면 의미가 없다. 그리고 개선 지표가 규정된다. 검증된 결과당 비용이 하네스가 개선되고 있는지 드러내는 지표다. 구체적 산수도 붙는다. 새 가이드 규칙이 재시도를 3에서 1로 줄이면 과제당 비용이 60% 떨어진다.
진짜 지표에 대한 규정도 강하다. 모델 호출이나 토큰, 메시지를 세지 말라. 대안이 제시된다. 수동 개입이 필요하지 않았고 여전히 받아들일 만한 증거를 생산한 완료된 과제를 세라. 그리고 이 지표의 기능이 명시된다. 시각적으로 인상적인 에이전트가 큰 사람 조율 세금을 숨기는 것을 막는다.
래칫과 실패 분류
개선 루프의 성격이 래칫으로 규정된다. 모든 실패가 시스템을 영구적으로 개선한다.
실패 분류표가 이 문서에서 가장 실용적인 부분이다. 약한 수정과 강한 수정이 짝지어져 있다. 알려진 나쁜 패턴은 프롬프트 알림 대신 린터 규칙으로, 맥락 부족은 더 긴 대화 대신 가이드 파일 항목으로, 잘못된 도구 사용은 대화 중 교정 대신 권한 경계로, 품질 이탈은 매 실행 사람 검토 대신 자동 테스트 스위트로, 상태 손실은 전부 재설명 대신 파일 기반 체크포인트로, 안전하지 않은 행동은 재발하지 않기를 바라는 대신 역량 예산과 거부로, 비용 초과는 수동 감시 대신 토큰 예산과 트립 와이어로 옮긴다.
통제 신뢰도 사다리도 층위를 명확히 한다. 메모리의 이전 교정은 신뢰도가 낮고 추가 비용이 0이다. 올라가면서 달라진다. 가이드 규칙은 중간 신뢰도에 몇 분, 자동 테스트는 높은 신뢰도에 몇 시간, 환경 수준의 권한과 스키마, CI는 가장 높은 신뢰도에 며칠이 든다.
여섯 단계 공학 루프도 제시된다. 똑같은 입력으로 실패를 재현하고 근본 원인을 분류하고 수정이 속할 가장 강한 계층을 식별하고 그 계층에서 구현하고 원래 실패 사례에서 검증하고 회귀 스위트를 돌려 기존 능력이 깨지지 않았는지 확인한다. 그리고 생략 금지가 명시되는데 이유가 각각 붙는다. 1단계를 빠뜨리면 유령을 고칠 수 있고 6단계를 빠뜨리면 하나를 고치면서 셋을 깨뜨릴 수 있다.
리뷰 코멘트를 제약으로 바꾸는 패턴이 Cursor 사례로 제시된다. 사람 리뷰어가 같은 리뷰 코멘트를 세 번 넘게 쓰면 그 코멘트는 구조적 제약이 되어야 한다. 진행 순서도 있다. 첫 번째는 가이드 규칙 추가, 두 번째는 가이드 규칙이 읽히는지 확인, 세 번째는 규칙을 위반하는 산출물을 막는 센서로 전환. 마무리가 짧다. 네 번째는 절대 일어나지 않아야 한다.
인용된 문장도 이 계층 논의를 요약한다. 프롬프트는 행동을 안내한다. 환경은 실패의 전체 부류를 막는다.
7일 구축 경로와 확장 게이트
구축 순서가 날짜별로 제시되고 각각 종료 시험이 붙어 있어 그대로 따라갈 수 있다. 1일은 빌드와 테스트, 린트가 담긴 AGENTS.md이고 시험은 에이전트가 셋을 올바르게 실행하는 것이다. 2일은 실패에서 나온 가이드 규칙 3개, 3일은 첫 계산적 센서, 4일은 에이전틱 루프와 재시도 예산, 5일은 파일 기반 상태 체크포인트, 6일은 권한과 비용 예산, 7일은 구조화된 로깅과 트립 와이어다.
순서에 대한 지시가 명확하다. 1~2일은 가이드 먼저이고 아직 센서를 추가하지 말라. 그리고 원칙이 반복된다. 각 계층이 신뢰할 만하다고 증명된 뒤에만 계층을 늘려라.
확장 게이트가 조건으로 제시되는데 모두 통과해야 다음으로 간다. 수동 교정 없는 완료율 80% 이상, 어떤 과제도 비용 예산을 초과하지 않음, 에이전트가 최소 한 번 올바르게 에스컬레이션함, 상태 체크포인트가 최소 한 번의 재시작에서 살아남음, 트립 와이어가 최소 한 번의 모의 이상에서 발동함, 권한 경계가 최소 한 번의 행동을 막음.
확장 방식도 규정된다. 한 번에 한 계층만 바꾸고 효과를 측정하고 점수표 지표가 하나라도 나빠지면 롤백하라.
의사결정 틀도 문제별로 시작점을 정해 준다. 알려진 오류가 반복되면 가이드 규칙에서 시작하고 아직 LLM 판사를 추가하지 말라. 산출 품질이 변하면 계산적 센서에서 시작하고 다중 에이전트 검토를 추가하지 말라. 에이전트가 범위를 넘으면 권한 경계에서 시작하고 전체 승인 워크플로를 추가하지 말라. 원칙이 짧다. 올바른 시작점은 항상 관찰된 실패를 다루는 가장 단순한 계층이다.
하네스를 만들지 말아야 할 때
이 문서의 균형이 여기서 드러난다. 모든 에이전트 상호작용이 공학적 부담을 정당화하지는 않는다.
값어치가 있는 조건이 열거된다. 에이전트가 같은 워크플로를 반복 실행하고 실패에 실제 결과가 있고 사람 감독 없이 작동하고 여러 세션이 상태를 보존해야 할 때. 반대 조건도 명확하다. 단발 질문, 창의적 브레인스토밍, 탐색적 대화, 일회성 과제는 가이드나 센서, 체크포인트에서 이득을 보지 못한다.
판별 질문 셋이 제시되는데 이 질문들이 계층별 필요를 각각 짚는다. 에이전트가 조용히 틀린 결과를 냈을 때 알아차리겠는가. 그렇다면 센서가 필요하다. 다음 세션에 같은 맥락을 다시 설명해야 하겠는가. 그렇다면 메모리가 필요하다. 실수가 외부 결과를 만들겠는가. 그렇다면 권한이 필요하다. 그리고 결론이 붙는다. 아무것도 해당하지 않으면 대화 자체가 하네스다.
흔한 실수들
한계를 다루는 절이 있는 점도 이 문서의 신뢰도를 만든다. 첫 실수가 과설계된 하네스다. 상태가 구체적이다. 500개 가이드 규칙과 12개 추론적 센서, LLM 판사 검토 3계층, 40단계 승인 워크플로. 판정이 신랄하다. 그것은 프로덕션 시스템이 아니라 안전으로 위장한 병목이다. 판별 기준도 제시된다. 에이전트가 일하는 것보다 자기 작업을 검사하는 데 더 많은 시간을 쓰면 하네스가 너무 무겁다.
두 번째가 정리되지 않는 가이드 파일이다. 구체적 충돌 사례가 인상적이다. 에이전트가 규칙 47번인 항상 오류 처리를 추가하라를 따르지만 규칙 183번인 함수를 20줄 아래로 유지하라를 위반하는데, 오류 처리가 10줄을 더하기 때문이다. 원인도 지목된다. 두 규칙은 몇 달 간격으로 다른 사람이 썼고 조정된 적이 없다.
세 번째가 잘못된 것을 시험하는 센서다. 신호가 제시되는데 이 지적이 예리하다. 모든 에이전트 실행에서 100% 통과율을 달성하는 테스트 스위트는 의심스럽다. 두 가능성이 열거된다. 테스트가 너무 쉽거나 에이전트가 문제를 실제로 풀지 않고 테스트를 통과하는 산출물을 만드는 법을 배웠다. 요구가 명확하다. 센서 스위트는 나쁜 작업을 거부해야 하고 좋은 형식만 확인해서는 안 된다.
네 번째가 정리 없는 메모리다. 문제가 구체적이다. 3주 전 체크포인트가 더 이상 존재하지 않는 파일과 되돌려진 결정, 대체된 산출물을 참조한다. 결과도 붙는다. 에이전트가 낡은 체크포인트를 읽고 시대에 뒤진 상태에 근거해 결정을 내린다.
다섯 번째가 가장 근본적이다. 하네스는 나쁜 목표를 고치지 못한다. 결과가 규정된다. 잘못 정의된 목표를 둘러싼 완벽하게 공학된 하네스는 신뢰할 수 있는 쓰레기를 생산한다. 그리고 증폭 관계가 명시되는데 이 경고가 문서의 마지막 균형추다. 하네스는 만든 사람이 고른 목표와 평가를 증폭한다. 시스템이 잘못된 것을 최적화하면 하네스는 오류의 규모를 늘린다.
복리 효과와 결론
하네스 공학의 가장 중요한 성질이 복리로 규정된다. 오늘 추가한 모든 가이드 규칙이 모든 미래 실행에서 오류의 부류를 막는다. 오늘 추가한 모든 센서가 모든 미래 산출에서 결함의 부류를 잡는다. 오늘 추가한 모든 권한 경계가 모든 미래 세션에서 사건의 부류를 막는다.
대비도 명확하다. 프롬프트 교정은 복리가 되지 않고 매 대화마다 다시 적용되어야 한다. 맥락 설정은 말뭉치가 커지면서 검색 품질이 떨어지므로 천천히 복리가 된다. 그리고 이유가 규정된다. 하네스 개선은 구조적이므로 빠르게 복리가 된다.
세 학문 분야가 모두 필요하다는 인정도 있다. 프로덕션 에이전트는 세 학문 분야가 함께 작동해야 한다. 각각의 역할이 배치된다. 프롬프트가 에이전트의 추론 방식과 과제 이해를 형성하고 맥락 파이프라인이 올바른 정보를 갖게 하고 하네스가 행동이 안전하고 검증되고 제한되고 관측 가능하고 지속적이게 한다.
다만 투자 우선순위는 분명하다. 다음 한 시간의 공학 시간을 어디에 투자할지 골라야 한다면 하네스가 거의 항상 가장 큰 한계 개선을 만든다. 근거가 짧다. 모델과 프롬프트는 같다. 하네스가 변수다.
결론이 한 문장으로 압축된다. 모델이 지능을 제공하고 하네스가 그 지능이 제품이 될지 데모로 남을지 결정한다.
🔗 최근 게시분과의 대조
| Harness Engineering | 최근 노트 |
|---|---|
| 실패마다 가장 강한 계층에 수정을 부호화 | Clare Liguori “에이전트가 틀릴 때마다 스티어링 파일에 뭐가 빠졌나” — 같은 래칫 |
| 계산적 센서 먼저, 추론적은 나중 | Clare Liguori “테스트 좌측 이동, 로컬 결정적 목 서비스” |
| 자기 검증으로 품질 기준 충족 시에만 복귀 | Clare Liguori “돌보기가 아니라 먹이 주기” — 동일 패턴 |
| 날짜 없는 200줄 가이드는 기술 부채 | Clare Liguori “이게 아직 필요한가, 맥락만 부풀리나” |
| 하네스는 나쁜 목표를 고치지 못한다 | Dan Luu “품질 실명” — 기준이 틀리면 센서도 틀린 것을 검증 |
| 에스컬레이션이 확신에 찬 오답보다 낫다 | 장대익 “AI는 절대 책임지지 않는다” / KISDI “책임의 공백” |
| 관측성 없으면 조용한 누락을 못 본다 | Bessemer “코드 줄 수를 증거로 추적하면 위약” |
특히 어제 게시한 Clare Liguori 발표와 거의 같은 결론에 다른 경로로 도달한다. 그쪽은 아마존 50개 팀 실측에서 다섯 습관을 뽑았고, 이 문서는 공개 자료 종합으로 여섯 계층을 정리했다. 두 문서를 나란히 놓으면 습관과 구조가 짝을 이루는데, 맥락 투자는 가이드 계층, 테스트 좌측 이동은 센서 계층, 먹이 주기는 자기 검증 패턴에 대응한다.
그리고 Dan Luu 노트가 이 문서의 가장 무거운 경고를 뒷받침한다. 하네스는 나쁜 목표를 증폭한다는 지적과 품질 실명은 같은 실패를 다른 층에서 짚는다. 센서가 있어도 기준이 틀렸으면 틀린 산출물을 신뢰할 수 있게 통과시킨다.
더 생각해보기
- GAIA 43.64점 차이가 이 문서의 핵심 근거인데, 최소 하네스와 프로덕션 하네스의 차이가 무엇이었는지 구성 요소별 기여도가 밝혀지지 않았다. 여섯 계층 중 어느 것이 몇 점씩 기여했는지가 투자 순서를 정하는 실제 정보다.
- 가이드 증가율이 감소해야 한다는 지표가 가장 세련된 측정이다. 규칙 추가 건수를 주별로 기록하는 것만으로 하네스 성숙도를 추적할 수 있고, 다시 늘어나면 새 실패 부류가 생겼다는 신호가 된다.
- 100% 통과율은 의심스럽다는 경고가 실무적으로 가장 유용하다. 테스트가 나쁜 작업을 거부한 적이 있는지 확인하려면 의도적으로 결함을 넣어 센서가 잡는지 시험하는 절차가 필요하다.
- 규칙 47번과 183번의 충돌 사례가 정확한데, 규칙 간 모순을 자동으로 탐지하는 방법이 없다. 가이드 파일 자체를 검증하는 센서가 다음 단계로 보인다.
- 에스컬레이션이 확신에 찬 오답보다 값어치 있다는 평가는 지표 설계와 충돌할 수 있다. 에스컬레이션률을 내려야 하는 지표로 두면서 동시에 에스컬레이션을 권장하면, 필요한 에스컬레이션과 불필요한 것을 구분하는 기준이 있어야 한다.
- 하네스가 나쁜 목표를 증폭한다는 경고는 여섯 계층 밖의 문제다. 그렇다면 목표와 수용 기준을 검토하는 절차가 0번째 계층으로 필요한데, 이 문서는 그것을 다루지 않는다.
- 7일 구축 경로가 즉시 실행 가능한 형태인데, 각 날짜의 종료 시험이 통과되지 않았을 때의 대응이 없다. 3일차 센서가 작동하지 않으면 4일로 갈지 머무를지가 실제로 흔한 상황이다.
- 이 문서 자체가 독립 편찬임을 명시하고 공식 규격이 아니라 저자의 구현용 적응이라고 밝힌 점은 정직하다. 다만 인용된 사례 대부분이 2026년 상반기 자료여서, 모델 세대가 바뀌면 기본값 숫자들은 재측정이 필요하다.