2026 AI Engineering Complete Guide

하네스
엔지니어링

AI를 더 잘 부르는 기술이 아니라,
AI가 잘못될 때를 대비해 시스템을 설계하는 기술

기준: 2026.04
OpenAI · Martin Fowler · Anthropic
AI 기본법 2026.01.22 시행
Level 01
기초버전
개념 정의 · 비유 · 핵심 원리 · 장단점 · 책임있는 AI · 국내외 사례 · 실천 가이드
FUNDAMENTALS
01 / 개념 정의
세 가지 엔지니어링, 한눈에 비교
AI 활용 방식의 진화 — 프롬프트 → 컨텍스트 → 하네스
💬
Prompt Engineering
프롬프트 엔지니어링
AI에게 "지금 이렇게 해줘"라고 좋은 질문을 던지는 기술. 단발성 지시 중심으로 요청의 품질이 결과를 결정합니다.
→ 무엇을 물어볼 것인가 | 2023~2024
📦
Context Engineering
컨텍스트 엔지니어링
AI가 더 잘 답할 수 있도록 배경 정보 꾸러미를 설계해서 보내는 기술. 정보의 양보다 구조와 관련성이 핵심입니다.
→ 무엇을 보낼 것인가 | 2025
🏗️
Harness Engineering
하네스 엔지니어링
AI 모델을 제외한 에이전트를 둘러싼 모든 것을 설계하는 기술. 도구, 권한, 피드백 루프, 샌드박스 전체를 포함합니다.
→ 시스템 전체를 어떻게 설계할 것인가 | 2026
🏗️ 하네스 엔지니어링
AI 시스템 환경 전체 — 린터, CI, 샌드박스, 권한, 모니터링, 재시도, 가드레일
Agent = Model + Harness
📦 컨텍스트 엔지니어링
하네스 내부 — RAG, MCP, 메모리, 대화 이력 등 모델이 추론 시 보는 모든 토큰
💬 프롬프트 엔지니어링
컨텍스트 내부 — 지시문, 역할 정의, 예시, Chain-of-Thought 등 입력 텍스트 최적화
02 / 비유와 예시
초등학생도 이해하는 비유
AI = 실력은 뛰어나지만 단독 운용은 못 믿는 전문가
Prompt
주문서 잘 쓰기
요리사에게 무엇을 만들지 명확하게 지시하는 행위
"페퍼로니 라지 사이즈 하나, 엣지 크러스트로."
Context
배경 정보 꾸러미
요리사가 더 잘 만들도록 상황 정보를 미리 전달
"4층, 인터폰 고장, 땅콩 알레르기, 지난번 치즈 과다."
Harness
주방 시스템 설계
요리사가 잘 할 수밖에 없는 환경 전체를 구축
알레르기 차단 잠금 + 배달 추적 + CCTV + 품질 피드백 자동화
Prompt
기수의 명령
기수가 말에게 "지금 이렇게 달려!"라고 하는 단발성 지시
"출발! 왼쪽으로! 빠르게!"
Context
출발 전 정보 꾸러미
코스 지도, 날씨, 상대 말 정보를 출발 전에 전달
"오늘 트랙은 진흙이고, 3번 말이 출발이 빠르니 안쪽 코스 유지."
Harness
트랙·안장·고삐 전체
말이 달리는 환경 전체 — 선 밖은 못 나가고, 잘못 가면 자동으로 당겨짐
울타리 + 안장 + 카메라 + 출발문 + 자동 속도 제한 시스템
Prompt
입주민 구두 요청
"소음 좀 줄여주세요" — 매번 새로 부탁해야 하는 단발성 지시
"밤 11시 이후엔 조용히 해주세요."
Context
관리 규칙집 배포
층간소음 규칙집, 쓰레기 분리수거 안내문 — 정보를 주어 더 잘 행동하게 유도
입주민 필독 안내문 (각 세대 배포)
Harness
건물 시스템 설계
CCTV, 화재 감지기, 층간소음 자동 감지, 출입 카드 시스템 — 개인 행동과 무관하게 시스템이 통제
규칙 위반 자동 감지 + 경보 + 기록 + 관리자 알림
03 / 핵심 원리
실무자가 알아야 할 3가지 원리
직무와 관계없이 모든 AI 활용자에게 공통으로 적용됩니다
PRINCIPLE 01
🔧
구조 입력 → 구조 출력
Structure In, Structure Out
  • 자유형 지시보다 구조화된 제약이 효과적
  • 컨벤션 문서를 파일로 버전 관리
  • 브랜드·코딩 규칙을 AI에게 직접 제공
  • 구조화되지 않은 지식은 AI에게 없는 것
직무 무관 모두 적용 가능
PRINCIPLE 02
🎛️
가이드 + 센서 이중 제어
Feedforward + Feedback Loop
  • 가이드만: 규칙 있어도 효과 확인 불가
  • 센서만: 같은 실수를 반복
  • 둘 다 설계해야 AI 자기 교정 가능
  • 린터·테스트 자동화 = 센서 역할
  • 시스템 프롬프트·가이드라인 = 가이드
사이버네틱 거버너 원리
PRINCIPLE 03
💾
하네스는 유지보수되는 소프트웨어
Harness as Code
  • 스킬·프롬프트·MCP 설정은 모두 코드
  • Git 버전 관리 + PR 팀 리뷰 필수
  • 최소 노출 원칙 — 필요한 것만 제공
  • Vercel: 도구 80% 제거 후 성능 향상
  • 대부분의 실패 원인은 하네스 설정 문제
표류(Drift) 방지가 핵심
04 / 장단점
핵심 장점 & 주의사항
✅ 핵심 장점
  • 예측 가능하고 재현 가능한 결과
    AI가 '마법 상자'에서 '신뢰 가능한 컴포넌트'로 전환됩니다.
  • 모델보다 하네스 개선이 더 효과적
    LangChain: 하네스만 교체해 TerminalBench 5위 등극. 모델 교체 없음.
  • 장기 에이전트 운용 가능
    메모리를 외재화해 세션이 끊겨도 작업이 이어집니다.
  • 수동 개발 대비 최대 10배 속도
    OpenAI 실험: 5개월, 100만 줄, 수동 코드 0줄.
⚠️ 주의사항
  • 초기 구축 비용이 높습니다
    Manus: 6개월, 5번 아키텍처 재설계. DB/OS 수준의 인프라 작업.
  • 하네스 표류(Drift) 지속 발생
    정기적 유지보수 없이는 AI 결과도 같이 표류합니다.
  • 도구 과다 제공 시 성능 저하
    MCP 서버 무분별 추가 → 컨텍스트 비대화 → 오히려 혼란.
  • 안전 설계 없는 자율 에이전트는 위험
    새벽 3시 API 재시도 루프로 비용 폭발한 실제 사례 존재.
05 / 책임있는 AI
책임있는 AI 6원칙 × 하네스 적용
한국 AI 기본법(2026.01.22 시행) 기준. 국내외 실제 적용 사례 포함
공정성
FAIRNESS
어떤 사람에게도 차별 없는 결과 보장. 특정 그룹 불이익을 자동으로 탐지·차단해야 합니다.
🇰🇷 국내 금융권

AI 신용평가에 설명가능성(XAI) 의무 부여. 거절 시 근거 설명 필수.
투명성
TRANSPARENCY
AI가 왜 그런 결과를 냈는지 이용자가 이해할 수 있어야 합니다. 블랙박스 AI는 책임있는 AI가 아닙니다.
🇰🇷 네이버 클로바X

AI 생성 라벨 부착, 출처 링크 의무화, 음성 명시적 동의 전환.
책임성
ACCOUNTABILITY
AI가 잘못했을 때 누가 책임지는지 명확해야 합니다. 자율 에이전트 시대에 특히 중요한 원칙입니다.
🇰🇷 AI 기본법

고영향 AI 사업자 위험관리 조직을 개발팀과 독립 운영 의무.
프라이버시
PRIVACY & SECURITY
내 정보를 AI가 함부로 사용하면 안 됩니다. 데이터가 어디로 가는지 이용자가 알아야 합니다.
🇨🇳 딥시크 논란

한국 120만 이용자 데이터 중국 서버 전송 의혹 → 개인정보보호위 조사 착수.
신뢰성
RELIABILITY & SAFETY
AI 실수에 대비한 안전망이 반드시 필요합니다. 고위험 영역은 인간이 최종 확인해야 합니다.
🌍 Google AI 요약

의료·법률 답변에 "전문가 확인 권고" 문구 자동 삽입 의무화.
포용성
INCLUSIVENESS
누구나 AI 혜택을 받아야 하고 소외되면 안 됩니다. 장애인·고령자를 포함한 보편 설계가 필요합니다.
🌍 TikTok

추천 유사성 77% 초과 시 다양성 강제 노출. 청소년 야간 제한 적용.
06 / 내 일상 속 하네스
이미 쓰고 있었습니다
하네스 엔지니어링은 낯선 기술이 아닙니다. 이미 우리 일상 속에 있습니다.
📱
인스타그램
피드백 센서
"이 게시물이 불쾌하세요?" → 알고리즘 즉시 반영
▶️
유튜브 안내
피드포워드 가이드
자해·혐오 검색 시 상담 전화 자동 안내
🏦
카카오뱅크
보안 하네스
AI 이상거래 감지 후 결제 자동 차단
🤖
ChatGPT 거절
권한 제한 하네스
위험한 질문에 답변하지 않는 것
📰
AI 뉴스 출처
투명성 하네스
AI 요약 옆 "원문 보기" 링크 자동 첨부
07 / 실천 가이드
오늘 바로 시작하는 4단계
STEP 01
문서화
규칙을 문서화하세요
  • 브랜드 가이드라인을 파일로 저장
  • 코딩 컨벤션을 레포에 커밋
  • 업무 원칙을 마크다운으로 정리
  • 매번 말하지 말고 문서를 읽게
STEP 02
체크포인트
인간 검토 포인트 설계
  • 계획 단계에서 사람이 먼저 확인
  • 금융·의료·법률은 반드시 적용
  • 마케팅 카피도 고위험 영역
  • 초기 단계 오류 발견이 훨씬 저렴
STEP 03
최소화
도구를 최소화하세요
  • 필요한 도구만 AI에게 허용
  • 권한·데이터 접근 범위 명시 제한
  • 도구 많을수록 혼란·실수 증가
  • Vercel 도구 80% 제거 후 향상
STEP 04
버전 관리
하네스를 버전 관리하세요
  • 시스템 프롬프트를 Git으로 관리
  • 변경 시 반드시 팀 리뷰 거치기
  • 혼자 수정하지 않기
  • 설정 표류 = AI 결과 표류
08 / 직군별 설명
마케터·PR 직군에게 설명하기
기술 용어 없이, 브랜드·리스크 언어로 바로 통하는 설명법
"
AI한테 매번 잔소리하지 않아도 되게,
처음부터 규칙을 심어두는 것
"
💬
이렇게 대화를 시작해보세요

AI로 카피 써본 적 있으시죠? 근데 쓸 때마다 톤이 달라지고, 어떤 날은 브랜드 분위기랑 전혀 다른 문장이 나오고. 그래서 결국 다시 수정하게 되잖아요.

그 이유가 뭐냐면, AI한테 매번 "우리 브랜드는 이런 느낌이야"라고 새로 알려줘야 하기 때문이에요. 마치 알바생이 출근할 때마다 처음 만나는 것처럼요.

하네스 엔지니어링은 그걸 바꾸는 거예요. 알바생한테 매번 교육하는 게 아니라, 아예 매뉴얼 북이랑 체크리스트를 만들어두고, 그걸 벗어나면 자동으로 걸리게 하는 시스템을 만드는 거죠.

첫째
프롬프트 엔지니어링은
"그때그때 부탁하는 것"
"친근한 톤으로 써줘", "보장 같은 말은 쓰지 마", "짧게 써줘" — 매번 이렇게 말해줘야 해요. 한 번 말하면 그 대화에서만 기억하고, 다음엔 또 잊어요.
둘째
컨텍스트 엔지니어링은
"배경 설명을 미리 챙겨주는 것"
대화 시작 전에 브랜드 가이드, 지난달 잘 됐던 카피 사례, 피해야 할 표현 목록을 한꺼번에 넣어주는 거예요. 그러면 AI가 훨씬 맥락에 맞게 써주죠. 근데 이것도 매번 챙겨야 해요.
셋째
하네스 엔지니어링은
"시스템을 한 번만 만들어두는 것"
브랜드 가이드, 금지 표현, 승인된 메시지 톤을 딱 한 번 설계해두면, 누가 써도, 언제 써도 그 안에서만 결과가 나와요. 신입 직원이 써도, 외부 대행사가 써도 똑같이요.
🔄 마케터·PR한테 가장 와닿는 말로 바꾸면
기술 용어
마케터 언어
하네스 엔지니어링
브랜드 가이드를 AI 안에 심어두는 것
피드포워드 가이드
출발 전에 규칙 알려주기
피드백 센서
잘못 나오면 자동으로 잡아주는 장치
권한 제한
AI가 할 수 있는 것과 없는 것을 미리 정해두기
컨텍스트 표류
AI가 점점 브랜드 분위기를 잊어가는 현상
실무에서 바로 쓸 수 있는 예시
⚖️
상황 1 — 법적 리스크
컴플라이언스 자동화
AI가 "환급 보장", "100% 절세" 같은 표현을 쓰면 안 되는 업종 있잖아요. 매번 "이런 말 쓰지 마"라고 할 게 아니라, 아예 그 단어들이 나오지 못하게 막아두는 거예요. 법무팀이나 컴플라이언스가 매번 검토 안 해도 되고요.
🎨
상황 2 — 브랜드 일관성
대행사·팀원 무관하게 동일한 톤
대행사 세 곳이 각각 AI로 콘텐츠를 만들어도, 우리 브랜드 톤이 유지되게 하려면 어떻게 해야 할까요. 매번 피드백 줄 게 아니라, 처음부터 같은 기준 안에서만 작업하게 틀을 잡아두는 거죠.
📊
상황 3 — 캠페인 품질
성과 데이터를 AI가 항상 참고
A/B 테스트에서 잘 됐던 표현, 반응 좋았던 후킹 문장들을 AI가 매번 참고하게 해두면, 새 캠페인 카피 뽑을 때마다 따로 찾아볼 필요가 없어요. 그 데이터가 이미 AI 작업 환경 안에 들어가 있으니까요.
AI한테 매번 설명하는 게 지치셨다면,
그 설명을 시스템으로 만들어두는 게 하네스 엔지니어링이에요.
AI를 더 잘 부르는 기술이 아니라,
AI가 잘못될 때를 대비해 시스템을 설계하는 기술
— HARNESS ENGINEERING · 2026
Level 02
고급버전
등장 배경 · 핵심 구성 요소 7가지 · 실험 데이터 · PEV 루프 · GitHub 레포 · 공식 레퍼런스
ADVANCED
08 / 등장 배경
세 가지 패러다임의 진화
2023
~24
PROMPT
프롬프트 엔지니어링 — "무엇을 물어봐야 하나?"
LLM에 전달하는 지시문 텍스트 최적화. 역할 정의, 예시 제공, Chain-of-Thought가 핵심 기법으로 부상했습니다.
설계 대상: 지시문 텍스트
2025
CONTEXT
컨텍스트 엔지니어링 — "무엇을 보여줘야 하나?"
LLM이 추론 시 보는 모든 토큰(RAG, MCP, 메모리, 대화 이력)을 설계하는 개념이 주목받기 시작했습니다.
설계 대상: 컨텍스트 윈도우 전체
2026
.02
HARNESS
하네스 엔지니어링 — "전체 환경을 어떻게 설계해야 하나?"
Mitchell Hashimoto가 블로그에서 개념 언급 후 OpenAI 공식 아티클로 확산. Thoughtworks Technology Radar Vol.34(2026.04)에 산업 핵심 트렌드로 공식 선정.
설계 대상: 에이전트 외부 환경 시스템 전체
09 / 핵심 구성 요소
하네스를 이루는 7가지 레이어
항목을 클릭해 상세 내용을 펼쳐볼 수 있습니다
📄
컨텍스트 파일
CLAUDE.md / AGENTS.md / .cursorrules
에이전트가 작업 시작 시 읽는 프로젝트 지침 파일. 빌드 명령, 코딩 규칙, 네이밍 컨벤션을 담습니다. OpenAI는 이것이 "system of record" 역할을 해야 한다고 강조했습니다.
## Build ./gradlew build # 전체 빌드 ./gradlew test # 테스트 실행 ## 코딩 규칙 - 패키지 방향: domain → app → infra - 엔티티는 기본 지연 로딩 - 커밋 메시지: 한국어, 마침표 없이
⚠️ 함정: 거대한 AGENTS.md에 모든 것을 담으면 에이전트가 중요 제약을 놓칩니다. 컨텍스트 윈도우는 희소 자원입니다. 맵(Map) 구조로 분리하세요.
🔌
MCP 서버
Model Context Protocol — 외부 도구 연동
에이전트가 외부 도구와 데이터 소스에 접근할 수 있게 합니다. 이슈 트래커 티켓 읽기, 브라우저 자동화, 내부 문서 검색 등이 가능해집니다.
claude mcp add --transport http \ jira https://mcp.jira.example.com/mcp claude mcp add --transport stdio github \ -- npx -y @modelcontextprotocol/server-github
⚠️ 도구 정의 자체가 토큰을 소비합니다. 현재 작업에 필요한 MCP 서버만 연결하고 나머지는 비활성화하세요.
📂
스킬 파일 (Skill Files)
Progressive Disclosure — 필요할 때만 접근
Anthropic이 Claude Code용으로 도입했으나, 현재 Codex·OpenCode 등 개방형 표준. 에이전트가 특정 작업이 필요하다고 판단할 때에만 해당 지침/도구에 접근하는 프로그레시브 디스클로저 원칙으로 작동합니다.
💡 모든 지침을 시스템 프롬프트에 넣으면 성능이 오히려 하락합니다. SKILL.md 파일 하나당 하나의 역할만 담는 것이 핵심 패턴입니다.
⚙️
기계적 강제 & 코드 가비지 컬렉션
Linter / CI / Structure Tests — 피드백 루프 자동화
하네스와 컨텍스트 엔지니어링이 가장 명확하게 분리되는 지점. 린터가 단순 오류 반환을 넘어, 실패 시 수정 지침을 에이전트 컨텍스트에 직접 주입하도록 설계합니다.
# 의존성 방향 강제 (OpenAI 사례) Types → Config → Repo → Service → Runtime → UI # 위반 감지 시 즉시 피드백 루프 활성화 # 백그라운드 가비지 컬렉션 에이전트 코드·문서 발산 스캔 → 리팩토링 PR 자동 생성
🤝
서브에이전트 & 컨텍스트 방화벽
Context Rot 방지 — 구조화된 결과물만 전달
장시간 실행 시 컨텍스트가 쌓이면서 성능이 저하되는 "컨텍스트 롯(Context Rot)" 해결. 에이전트 간에는 날 것의 대화가 아닌 구조화된 결과물만 전달합니다.
Initializer Agent → 작업 계획 + 피처 목록(200개+) 생성 → 모두 "미완성" 상태로 기록 ↓ Coding Agent(s) → 각 피처 독립 실행 (컨텍스트 방화벽) → 완성 시 "완료"로 업데이트 → 진행 로그에 이어서 기록
🛡️
샌드박스 & 보안 레이어
Control Plane / Compute Plane 엄격 분리
OpenAI의 공식 샌드박스 아키텍처 원칙: 하네스 컨트롤 플레인(인증·빌링·오케스트레이션)과 샌드박스 컴퓨트 플레인(파일·셸·포트)의 엄격한 분리. 매니페스트 계약, 재개 가능한 세션 상태를 포함합니다.
컨트롤 플레인: 인증, 빌링, 오케스트레이션, 세션 상태 ↕ (매니페스트 계약) 컴퓨트 플레인: 파일 시스템, 셸 실행, 포트, 샌드박스 메모리
📊
관찰 가능성 & 추적 (Observability)
OpenTelemetry / LangSmith / Arize Phoenix
모든 AI 판단과 도구 호출을 자동으로 기록하고 분석하는 레이어. LangChain이 LangSmith 트레이스 기반으로 실패 패턴을 분석해 TerminalBench 30위에서 5위로 향상시킨 핵심 방법론입니다.
OTEL 추적 → 에이전트 모든 추론 단계 기록 LangSmith → 실패 패턴 자동 분석 Arize Phoenix → 오프라인 감사 및 재현 AI 판사(LLM-as-Judge) → 품질 등급 자동 업데이트
10 / PEV 루프
Plan → Execute → Verify
에이전트가 작업을 스스로 검증하도록 강제하는 핵심 피드백 루프
📝
PLAN
에이전트가 작업 목록 작성. 세부 단계 분해 후 실행 전 인간 검토 체크포인트 삽입.
EXECUTE
각 항목 순차 실행. 린터·테스트·빌드를 자동 실행하며 결과를 컨텍스트에 주입.
VERIFY
스스로 결과 확인. 빌드 통과? 테스트 통과? UI 비교? 실패 시 자동 루프 재시작.
설계 원칙: 실패는 크게, 성공은 조용히. 에이전트 컨텍스트에 장황한 성공 출력을 쏟아붓지 마세요. 실패 메시지에는 반드시 수정 지침을 포함하세요.
11 / 실험 데이터
하네스가 결과를 바꾼 증거
모두 모델 가중치 변경 없이, 하네스만 개선한 결과입니다
EXPERIMENT 01 — OpenAI Codex
100만 라인, 수동 코드 0줄
하네스 기반 5개월 프로젝트
기간2025.08~2026.01
팀 규모3→7명
수동 작성 코드0줄
AI 생성 코드~100만 라인
병합된 PR약 1,500개
10×수동 개발 대비 속도 향상
EXPERIMENT 02 — Hashline Format
편집 형식만 바꿨더니
6.7% → 68.3% 폭등
연구자Can Boluk (2026.02)
변경 사항도구 형식만 변경
모델 변경 여부없음 (가중치 고정)
출력 토큰-20% 효율화
대상 모델Grok Code Fast 1
+61.6%p하네스만 변경한 성능 향상폭
EXPERIMENT 03 — LangChain
모델 고정, 하네스만 개선
Terminal Bench 30위 → 5위
사용 모델gpt-5.2-codex (고정)
개선 전 점수52.8% (30위)
개선 후 점수66.5% (5위)
향상폭+13.7%p
방법자기 검증 루프 추가
30→5위모델 교체 없이 25계단 상승
12 / GitHub 레포지토리
지금 바로 활용 가능한 도구들
walkinglabs/awesome-harness-engineering
github.com/walkinglabs/awesome-harness-engineering
하네스 엔지니어링 도구 및 가이드 종합 모음. Citadel(Claude Code & Codex 격리 하네스), Harbor(에이전트 평가·개선), Harness Evolver(하네스 자율 진화) 포함.
CitadelHarborHarness Evolverskills.sh
ai-boost/awesome-harness-engineering
github.com/ai-boost/awesome-harness-engineering
문제 유형별 하네스 컴포넌트 정리. OpenAI "A Practical Guide to Building AI Agents"(2026.04), NVIDIA OpenShell, Microsoft Agent Governance Toolkit 포함.
OWASP Top10OpenShellGovernance
aiming-lab/AutoHarness
github.com/aiming-lab/AutoHarness
AI 에이전트용 자동화 하네스 프레임워크. 3단계 파이프라인, 6단계 거버넌스, 리스크 패턴 매칭, YAML 컨스티튜션, 트레이스 기반 진단. v0.1.0 공개.
AutoHarness.wrap()958 tests ✓v0.1.0
HKUDS/OpenHarness
github.com/HKUDS/OpenHarness
완전한 하네스 아키텍처를 갖춘 오픈소스 에이전트 런타임. Claude/OpenAI/Codex/Kimi 등 다중 공급자 지원. Auto-Compaction(컨텍스트 압축 시 태스크 상태 보존) 내장.
pip install openharness-aiMulti-providerAuto-Compaction
13 / 공식 레퍼런스
필독 1차 문서 모음
01
OpenAI — Harness Engineering in an Agent-First World
openai.com/index/harness-engineering/
개념 공식화, 100만 라인 실험 보고. 하네스 엔지니어링이라는 용어가 업계에 정착된 결정적 문서.
02
Mitchell Hashimoto — My AI Adoption Journey
mitchellh.com/writing/my-ai-adoption-journey
하네스 엔지니어링 용어 최초 사용. 에이전트 실수 반복 방지를 위해 시스템을 바꿔야 한다는 핵심 원칙 제시.
03
Martin Fowler — Harness Engineering for Coding Agent Users
martinfowler.com/articles/exploring-gen-ai/harness-engineering
가이드·센서·컴퓨테이셔널 요소·하네스 템플릿 등 가장 체계적인 개념 정리.
04
LangChain — Improving Deep Agents with Harness Engineering
blog.langchain.com/improving-deep-agents-with-harness-engineering/
Terminal Bench 실험 상세 분석. 실패 패턴 분석 + 자기 검증 루프 적용 사례.
05
Anthropic Engineering — Effective Harnesses for Long-Running Agents
anthropic.com/engineering/effective-harnesses-for-long-running-agents
이니셜라이저 에이전트, 피처 목록 외재화, 자기 검증 아키텍처 상세 설명.
06
Thoughtworks Technology Radar Vol.34 (2026.04)
thoughtworks.com/radar
하네스 엔지니어링을 산업 핵심 매크로 트렌드로 공식 선정. 실험→반복성·안정성 추구 단계로 이동 평가.
14 / 실전 체크리스트
처음 시작하는 팀을 위한 Quick Start
모든 메커니즘을 한꺼번에 구축할 필요 없습니다. 이 세 가지가 가장 빠른 ROI를 냅니다.
Step 1 — 컨텍스트 파일 작성
  • CLAUDE.md / AGENTS.md 생성
  • 빌드 명령, 테스트 방법 기록
  • 코딩 규칙, 금지 패턴 명시
  • 에이전트 실수마다 규칙 추가
Step 2 — MCP 선택적 연결
  • 자주 참조하는 외부 시스템만 연결
  • 이슈 트래커, 위키가 대표적
  • 불필요한 연결은 토큰 낭비
  • 도구 수 최소화 원칙 적용
Step 3 — 린터 & CI 연결
  • 기존 린터/CI 출력을 AI가 읽게 구성
  • CI 실패 → 에이전트 자동 수정 루프
  • 실패 메시지에 수정 지침 포함
  • PEV 루프로 자기 검증 강제
모델을 바꾸기 전에
하네스를 먼저 점검하세요.
하네스가 더 높은 ROI를 제공하는 경우가 훨씬 많습니다.
— OpenAI · LangChain Terminal Bench 실험 결과 · 2026