Design · Development · Thoughts

안녕하세요,
Practical AI Lab 입니다.

AI·에이전트·LLM 실전 연구

Claude 연구 자동화 26%, 완전 자율 연구라는 뜻일까?


반응형

사람의 감독 다이얼이 연결된 연구 큐브와 연구 자동화 26%의 의미 제목

Claude 연구 자동화 26%는 사람이 사라진 연구소를 뜻하지 않습니다. 2026년 9월 20일 확인한 Anthropic 공개 자료에서 이 수치는 2026년 8월 기준, 사람이 감독하는 가운데 AI가 주도하는 연구·개발 업무의 가중 비중이며, 측정된 업무 중 완전 자율 단계에 도달한 영역은 없었습니다.

이 글은 Anthropic의 Measurements for understanding the pace of AI development inside frontier labs와 방법론 부록, Epoch AI의 자동화 측정 제안을 바탕으로 숫자의 분모와 판정 기준을 살펴봅니다.

이 글의 핵심
  • 이번 공개 자료가 측정한 대상
  • 협업·주도·완전 자율을 나누는 기준
  • 26%를 만드는 표본과 가중치
  • 연구 에이전트 감독에서 확인할 지표
  • 후속 공개에서 비교해야 할 조건
먼저 팩트체크할 부분

업무 비중을 연구원 대체율, 연구 시간 절감률 또는 성능 향상률로 바꾸어 읽으면 안 됩니다. 공개 시점과 측정 시점도 다르므로 ‘오늘 연구의 26%를 자동 처리한다’고 단정하지 않습니다.

원문: Anthropic의 AI 개발 측정 지표와 방법론


1. Claude 연구 자동화 26%는 무엇을 측정했나

벤치마크 대신 실제 업무를 관찰했습니다

이번 지표의 대상은 Anthropic 내부 모델 연구·개발입니다. 정답이 정해진 문제를 푸는 능력보다, 조직 안에서 어떤 일이 어느 정도 위임되고 있는지에 초점을 맞춥니다.

외부 기업까지 대표하는 통계는 아닙니다

특정 회사의 업무 기록과 평가 체계로 얻은 결과입니다. 일반 소프트웨어 팀이나 다른 AI 연구소의 자동화 수준으로 확대하려면 별도의 측정이 필요합니다.


2. AL3·AL4·AL5는 사람의 개입이 어떻게 다른가

협업 AL3·주도 AL4·완전 자율 AL5의 사람 개입 차이

협업은 밀착 지휘, 주도는 감독 아래 수행입니다

Anthropic은 Epoch AI가 제안한 AL0~AL5 척도를 사용했습니다. AL3에서는 AI가 큰 작업 덩어리를 처리하더라도 사람이 가까이서 방향을 잡습니다. AL4에서는 높은 수준의 지시만 받고 대부분의 과정을 끝까지 수행하며, 사람은 감독합니다. AL5는 사람의 필수 개입 없이 작동하는 단계입니다.

공식 파이프라인 복구 예시에서 배포 결정은 사람이 합니다

원문의 각주는 야간 데이터 파이프라인 장애를 예로 듭니다. AL4의 Claude는 로그 조사, 수정, 테스트, 데이터 사본을 이용한 재실행과 정상 결과 비교까지 수행하지만 직접 배포하지 않습니다. 담당자가 보고서를 읽고 변경을 검토한 뒤 배포 시점을 정합니다. 이는 설명을 위한 공식 예시이며 이 블로그의 실행 실험은 아닙니다.

작업 완료를 테스트 한 번으로 판단하기 어려운 이유는 AI 코딩 에이전트 검증 루프: 테스트 통과와 완료의 차이에서 다뤘습니다. 여기서는 그 검증을 누가 주도하고 누가 최종 결정하는지가 단계 구분의 핵심입니다.


3. 26%와 90% 초과 수치는 어떻게 계산했나

7월 업무 표본 수집에서 가중 집계까지 네 단계

7월 업무 목록을 고정하고 시점별 자동화 수준을 붙입니다

방법론 부록에 따르면 2026년 7월의 각 주마다 모델 연구·개발 관련 부서 직원의 20%를 무작위로 표집했습니다. Claude 연구 에이전트가 Slack과 내부 문서를 읽어 약 1만 5천 개의 세부 업무를 모았고, 이를 전체 542개 노드·말단 378개 범주의 계층으로 정리했습니다. 이 업무 분류표를 고정한 상태에서 각 시점의 자동화 정도를 평가합니다.

각 업무 범주의 수행 방식을 조사한 뒤 별도의 Claude 판정 모델이 근거를 읽고 AL 등급을 붙입니다. 특정 월을 평가할 때에는 그달까지의 자료만 보게 했습니다. 다만 ‘별도 판정 모델’이라는 말은 외부 독립기관이 평가했다는 뜻이 아닙니다.

업무 개수를 그대로 세지 않고 인력 투입을 근사합니다

가중치는 사람마다 한 주에 한 단위를 부여하고 그 주에 수행한 업무에 균등 분배하는 방식입니다. 실제 분 단위 작업 시간을 측정한 값이 아니라 인력 투입 비중의 근사치입니다. 따라서 세부 업무 한 건과 한 건을 똑같이 세어 얻은 단순 비율로 설명하면 부정확합니다.

공개된 값 의미 뜻하지 않는 것
26% AI 주도 단계로 평가된 업무의 가중 비중 연구원 26% 대체
90% 초과 AI 협업 이상에 해당하는 업무 비중 추가로 90%가 따로 자동화됨
완전 자율 영역 없음 측정 대상 중 AL5에 도달한 부분 없음 모든 미래 업무에서도 자율화가 불가능함

‘협업 이상’에는 그보다 높은 ‘주도’ 단계도 포함됩니다. 두 비율을 더해 전체 자동화율을 만들지 않습니다.


4. 연구 에이전트가 늘면 감독에서 무엇을 봐야 하나

행동 실행 전 온라인 검사와 실행 후 오프라인 분석 경로

실행 전 차단과 실행 후 조사는 역할이 다릅니다

온라인 모니터는 행동 실행 전에 검사해 차단하거나 방향을 수정합니다. 오프라인 모니터는 실행 뒤 기록에서 장기적인 문제를 찾습니다. 도해의 ‘진행’은 검사 통과를 뜻하며 안전 보증은 아닙니다.

감독 수치는 가장 많이 쓰인 내부 플랫폼에 한정됩니다. 도구를 통한 데이터 반출 위험의 사례는 OpenAI 에이전트 무단 업로드, 인용·파일 공유에서 생긴 일과 연결해 볼 수 있습니다.

감시 범위와 탐지 성능을 분리해서 읽습니다

Anthropic은 해당 플랫폼 행동의 100%가 실행 전 온라인 모니터를 거치고 실행 후 오프라인 모니터로 수집된다고 밝혔습니다. 그러나 100%는 수집·검사 범위이지 위험 행동을 놓치지 않는다는 탐지율이 아닙니다.

운영 관점에서 함께 볼 항목은 감독 범위, 검토 지연, 차단·상향 검토 비율입니다. 원문은 온라인에서 차단된 행동을 사람이 일주일 안에 검토한다고 설명합니다. 실시간 자동 검사와 사람의 최종 검토가 같은 시간에 이루어진다고 추정하지 않아야 합니다.


5. 후속 공개에서 비교해야 할 조건은 무엇인가

등급 판정에는 여전히 경계 사례가 있습니다

부록은 모델과 담당자의 등급이 정확히 일치한 비율을 59%, 사람끼리의 일치율을 35%로 보고합니다. 모델과 사람의 판정이 한 단계 이내였던 비율은 97%였습니다. 이것만으로 모델이 절대적으로 정확하다고 결론 내릴 수는 없습니다. 협업과 주도의 경계 자체에 해석 차이가 남아 있다는 근거로 보는 편이 적절합니다.

업무 분류표의 버전과 외부 검증을 확인합니다

고정된 7월 업무 목록은 시계열 비교에 유리하지만 이후 새로 생긴 일을 자동으로 담지는 못합니다. Anthropic은 분류표를 주기적으로 다시 만들고 자동화 수치의 버전을 관리할 계획이라고 밝혔습니다. 서로 다른 시점의 비율을 비교할 때는 동일한 분류표인지 먼저 확인해야 합니다.

  • 측정 월과 업무 분류표의 기준 월이 명시되어 있는가?
  • 등급 정의와 가중치 방식이 유지됐는가?
  • 내부 모델 평가와 외부기관 검증 결과가 구분되는가?
  • 상향된 자동화 수준에 맞춰 감독 지연과 탐지 시험도 공개되는가?

위 목록은 이 글의 검토 제안입니다. 제3자 평가자의 내부 접근 계획을 이번 수치의 외부 검증 완료로 해석하지 않습니다.


6. Q&A와 정리

Q1. 내부 Slack 기록을 외부에서도 볼 수 있나요?

공개된 것은 방법론과 집계 결과이지, 직원별 원본 기록 전체가 아닙니다. 독자는 공개 정보로 계산 설계를 검토할 수 있지만 원자료에서 같은 수치를 독립 재현하는 데는 제약이 있습니다.

Q2. 도구 사용 허용만 늘리면 자동화 등급이 올라가나요?

접근 권한 확대는 수행 가능한 행동을 늘릴 뿐, 그 업무를 신뢰할 만하게 끝내는 능력을 입증하지 않습니다. 이번 방법은 권한 설정 개수가 아니라 실제 수행 방식의 근거를 평가합니다.

Q3. 이 지표를 채용 규모 예측에 써도 되나요?

해당 지표에는 미래 채용 계획이나 인력 수요를 추정하는 모형이 포함되어 있지 않습니다. 조직이 확보한 여력을 새로운 과제에 투입할 수도 있어 별도의 자료가 필요합니다.

Q4. 연구 생산성을 비교하려면 무엇을 더 봐야 하나요?

품질이 확인된 연구 성과, 재현 가능성, 실패한 실험 비용, 검토에 든 시간 등 결과 측면의 지표가 필요합니다. 자동화 비중 하나만으로 연구 효율의 우열을 정하기 어렵습니다.

Q5. 연말 수치를 그래프로 외삽해 확정해도 되나요?

추세 연장은 가정에 따른 전망이며 후속 관측값이 아닙니다. 새 측정이 나왔을 때 예상치와 구분해 갱신해야 합니다.

다음 발표를 읽을 때에는 숫자 옆에 기준 월·업무 목록 버전·검증 주체를 함께 적어두면 비교 오류를 줄일 수 있습니다.


7. 참고 자료

반응형