Safety

Google DeepMind AutoHarness: 작은 모델이 큰 모델을 이기는 하네스 엔지니어링 증명

Google DeepMind 연구팀이 AutoHarness 논문을 공개했다. AI 에이전트에 실행 가능한 코드 하네스를 자동으로 씌워서, 작은 모델(Gemini-2.5-Flash)이 큰 모델(Gemini-2.5-Pro, GPT-5.2)을 이기게 만드는 프레임워크다. 하네스 엔지니어링이 학술적으로 정의되는 순간이다.

Kaggle GameArena 체스 대회에서 Gemini-2.5-Flash의 패배 원인을 분석한 결과가 충격적이었다. 패배의 78%가 잘못된 전략 때문이 아니라, 체스 규칙상 허용되지 않는 불법 수(illegal move) 때문이었다. 모델은 전략을 알고 있었지만, 규칙에 맞는 행동으로 변환하는 과정에서 실패한 것이다. Google DeepMind의 6명의 연구자(Xinghua Lou, Miguel Lázaro-Gredilla, Antoine Dedieu, Carter Wendelken, Wolfgang Lehrach, Kevin P. Murphy)는 이 문제를 해결하기 위해 AutoHarness를 설계했다. 2026년 2월 arXiv에 공개(arXiv:2603.03329)되고, ICLR 2026 Recursive Self-Improvement 워크숍에서 발표되었다.

항목내용
논문 제목AutoHarness: Improving LLM Agents by Automatically Synthesizing a Code Harness
저자Xinghua Lou 외 5인 (전원 Google DeepMind)
arXiv2603.03329 (2026년 2월 10일)
발표ICLR 2026 Recursive Self-Improvement Workshop
핵심 발견Gemini-2.5-Flash + 하네스 > Gemini-2.5-Pro (하네스 없음)
벤치마크145개 TextArena 게임, 불법 행동 100% 제거
핵심 수치Gemini 패배의 78%가 전략 실패가 아닌 불법 수 때문

AutoHarness가 해결하는 문제는 무엇인가?

AI 에이전트의 실패 원인 대부분은 "모델이 멍청해서"가 아니라 "모델이 환경의 규칙을 지키지 못해서"다. Gemini-2.5-Flash의 체스 패배 78%가 전략 실패가 아닌 불법 수(illegal move)에서 발생했다. AutoHarness는 에이전트의 행동에 규칙 준수 레이어를 자동으로 씌워서 이 문제를 구조적으로 해결한다.

이것은 체스에만 해당하는 문제가 아니다. 기업 환경에서 AI 에이전트가 실패하는 패턴도 동일하다. 보고서를 쓸 때 존재하지 않는 논문을 인용하고(딜로이트 사건), 코드를 생성할 때 런타임 에러를 일으키고, API를 호출할 때 잘못된 파라미터를 전달한다. 모델은 "무엇을 해야 하는지"는 알지만, "어떻게 하면 규칙에 맞는지"에서 실패한다. 하네스는 이 간극을 메운다.

AutoHarness는 어떻게 작동하는가?

AutoHarness는 두 가지 모드로 작동한다. Action-Verifier 모드는 모델의 행동을 실시간으로 검증하고 불법 행동을 차단한다. Code-as-Policy 모드는 전체 의사결정 로직을 실행 가능한 코드로 변환해 모델 호출 자체를 제거한다.

LLM 에이전트 Gemini-2.5-Flash (전략 담당) 하네스 (자동 생성 코드) ① Action-Verifier 행동의 규칙 적합성 실시간 검증 불법 행동 거부 → 재제안 요청 불법 행동 100% 제거 ② Code-as-Policy 의사결정 로직을 코드로 변환 추론 시 LLM 호출 없이 실행 비용 절감 + 결정론적 행동 환경 체스판·업무 시스템 API·데이터베이스 행동 제안 거부 시 재제안 검증된 행동 환경 피드백 → 하네스 정제 (트리 탐색·변이)
AutoHarness 구조도: 모델은 전략을, 하네스는 규칙 준수를 담당한다. 하네스 자체도 환경 피드백으로 자동 정제된다.

모드 1: Action-Verifier: 행동을 검증하고 차단한다

모델이 행동을 제안하면, 하네스가 규칙 적합성을 실시간으로 확인한다. 불법 행동은 거부하고, 모델에게 다시 제안하도록 요청한다(rejection-sampling loop). 모델은 여전히 전략을 담당하고, 하네스는 규칙 준수만 담당한다. 가장 작은 코드 패치로 가장 큰 효과를 얻는 접근이다.

모드 2: Code-as-Policy: 로직 자체를 코드로 만든다

모델이 한 번 프로그램을 작성하면, 이후 추론 시점에서는 LLM 호출 없이 그 프로그램이 직접 실행된다. 비용이 극적으로 줄어들고, 결정론적 행동이 보장된다.

하네스 생성 방법: 프로그램 공간 탐색

하네스를 사람이 작성하는 것이 아니라, 자동으로 생성한다는 점이 AutoHarness의 핵심이다. LLM(Gemini-2.5-Flash)이 하네스 코드의 변이(mutation) 연산자 역할을 하고, Thompson 샘플링 기반 트리 탐색으로 최적의 하네스 구조를 찾는다. 환경에서 피드백을 받아 여러 라운드에 걸쳐 하네스를 정제한다.

벤치마크 결과는 어떤가?

145개 TextArena 게임에서 테스트한 결과, Action-Verifier 모드는 불법 행동을 100% 제거했고, Gemini-2.5-Flash + 하네스가 하네스 없는 Gemini-2.5-Pro를 능가했다. Code-as-Policy 모드는 16개 단일 플레이어 게임에서 Gemini-2.5-Pro와 GPT-5.2-High보다 높은 보상을 달성하면서 비용은 더 낮았다.

구성불법 행동성능
Gemini-2.5-Flash (하네스 없음)패배의 78%가 불법 수기준선
Gemini-2.5-Flash + Action-Verifier0% (완전 제거)Gemini-2.5-Pro 능가
Gemini-2.5-Flash + Code-as-Policy0%Gemini-2.5-Pro, GPT-5.2-High 능가 (더 낮은 비용)
작은 모델 + 좋은 하네스 > 큰 모델 + 하네스 없음. 이것이 하네스 엔지니어링의 핵심 명제이고, Google DeepMind이 145개 게임에서 실증한 결과다.

하네스 엔지니어링이 학문으로 정립되고 있다는 신호는?

AutoHarness는 단독 논문이 아니다. 2026년에 들어 하네스 관련 논문이 연속으로 발표되면서, 하네스 엔지니어링은 독립적인 연구 분야로 정립되고 있다.

6개월 사이에 Google DeepMind, 독립 연구팀, 그리고 Lilian Weng의 종합 서베이까지: 하네스가 AI 에이전트의 핵심 아키텍처 레이어로 인정받는 흐름이 형성되고 있다.

기업 AI 도입에 주는 시사점은 무엇인가?

AutoHarness의 가장 실용적인 교훈은 명확하다. 더 큰 모델을 사는 것보다, 기존 모델에 좋은 하네스를 씌우는 것이 더 효과적이고 더 저렴하다.

기업이 AI 에이전트를 도입할 때 가장 흔한 실수는 "더 좋은 모델을 쓰면 문제가 해결될 것"이라고 기대하는 것이다. AutoHarness는 이 가정이 틀렸음을 실증한다. Gemini-2.5-Flash(작은 모델)에 하네스를 씌우면 Gemini-2.5-Pro(큰 모델)보다 성능이 높고 비용은 낮다.

이것은 AX is의 하네스 엔지니어링 프레임워크(Prompt → Context → Harness → Loop)에서 세 번째 단계 Harness의 가치를 학술적으로 증명한 것이다. 프롬프트를 아무리 정교하게 쓰고(Prompt), 맥락을 풍부하게 제공해도(Context), 출력에 규칙 준수 레이어가 없으면(Harness 부재) 에이전트는 불법 행동을 한다. 딜로이트가 가짜 논문을 납품한 것도, Gemini가 불법 수를 둔 것도, 구조적으로 같은 문제다. 하네스의 부재.

Google DeepMind의 AutoHarness는 하네스 엔지니어링을 직관이나 경험론에서 학술적으로 검증된 방법론으로 격상시켰다. "작은 모델 + 좋은 하네스 > 큰 모델 + 하네스 없음"이라는 명제는 이제 145개 게임의 실험 데이터로 뒷받침된다. 기업이 AI 에이전트를 프로덕션에 배포하려면, 모델 선택보다 하네스 설계에 투자해야 한다. 딜로이트 사건이 하네스 부재의 대가를 보여주고, LLM-as-a-Judge 검증 에이전트가 하네스의 구현 방법을 제시하며, AutoHarness가 그 효과를 학술적으로 증명한다. 하네스 엔지니어링은 더 이상 선택이 아니다.

참고: AutoHarness (arXiv:2603.03329), Google DeepMind, ICLR 2026 RSI Workshop · Harness Engineering for Self-Improvement, Lilian Weng (2026.07.04)

이 주제의 전체 그림: 하네스 엔지니어링 총론

AI 에이전트에 하네스를 씌울 준비가 되셨나요?

하네스 엔지니어링 프레임워크 기반의 AI 에이전트 설계부터 검증 체계 구축까지, 기업 맞춤 AI 안전 체계를 함께합니다.

하네스 엔지니어링 상담하기