AI 코딩 에이전트 검증 루프: 테스트 통과와 완료의 차이
AI 코딩 에이전트 검증 루프는 코드 변경 뒤 테스트와 실제 결과 상태를 확인하고, 실패 원인을 다음 수정에 돌려주는 절차입니다. 테스트가 모두 통과해도 검사에 빠진 요구사항까지 충족했다는 뜻은 아닙니다. 2026년 9월 17일 기준 Anthropic의 에이전트 평가·장기 실행 하네스 문서와 Node.js 공식 문서를 바탕으로, 완료 판정의 범위와 짧은 재현 실험을 설명합니다.이 글의 핵심응답·실행·결과 상태를 구분하는 기준실패를 수정으로 연결하는 검증 루프의 구성테스트 범위를 넓혔을 때 달라지는 실제 실행 결과코드 검사·모델 평가·사람 검토의 역할 분담테스트 변경과 환경 차이를 다루는 운영 체크리스트주요 원문: Demystifying evals for AI agents · Effective harnes..