
앤트로픽 R&D 자동화 지수는 앤트로픽이 자사 AI 연구개발 업무를 AI가 얼마나 대신하고 있는지 측정해 공개한 지표입니다. 2026년 9월 17일 앤트로픽 인스티튜트가 발표한 첫 수치는 이렇습니다. 2026년 8월 기준으로 클로드가 사내 AI 연구개발의 26%를 주도하고, 사람과 협업하는 수준 이상으로 관여하는 비율은 90%를 넘습니다. 다만 사람 없이 완결하는 완전 자율 단계는 아직 없다고 명시했습니다.
AI 회사가 “우리 일을 AI가 얼마나 하는지”를 스스로 숫자로 내놓은 건 이번이 처음에 가깝습니다. 개발 속도를 늦추자는 논의가 한창인 시점이라 더 눈길이 갑니다. 아래에서 지표의 구조와 숫자, 한계까지 정리했습니다.
앤트로픽 R&D 자동화 지수는 어떻게 만들어졌나요?
정식 이름은 앤트로픽 R&D 자동화 지수(Anthropic R&D Automation Index)입니다. 만드는 방식은 생각보다 품이 듭니다.
- 2026년 7월 한 달간 매주 모델 개발 부서 인원의 20%를 무작위로 뽑습니다.
- 클로드 연구 에이전트가 슬랙과 사내 문서를 읽고 그 사람이 그 주에 한 일을 목록으로 만듭니다.
- 이렇게 모인 약 1만 5,000개 세부 업무를 계층 구조로 정리해 542개 노드, 그중 378개 말단 항목으로 고정합니다.
- 항목마다 판정 모델이 자동화 수준을 매기고, 투입된 사람 시간을 가중치로 합산합니다.
업무 목록을 고정했다는 점이 중요합니다. 기준이 매번 바뀌면 지수가 올라도 의미를 알 수 없습니다.
26%를 “주도”한다는 건 어느 정도인가요?
자동화 수준은 에포크 AI(Epoch AI)가 제안한 AL0~AL5 척도를 씁니다. 핵심은 AL3과 AL4의 차이입니다.
- AL3(협업): 사람이 문제와 가설을 어느 정도 정리해 맡깁니다. 중간에 예상 못 한 문제가 나오면 AI가 멈추고 사람이 판단합니다.
- AL4(주도): 사람은 “이 파이프라인 고쳐줘” 정도만 지시합니다. 로그 확인, 원인 파악, 수정, 검증에 더해 중간 돌발 상황까지 AI가 처리하고 결과를 보고합니다. 배포 결정은 사람 몫입니다.
- AL5(완전 자율): 사람이 문제를 알려주지 않아도 AI가 스스로 감지하고 배포까지 끝냅니다. 앤트로픽은 이 단계에 도달한 업무는 없다고 밝혔습니다.
즉 26%는 “사람이 안 해도 된다”가 아니라 “사람이 계속 붙어 있지 않아도 된다”에 가깝습니다.
에이전트 3만 개는 누가 감시하나요?
두 번째 지표가 감시 체계입니다. 2026년 8월 기준으로 가장 많이 쓰는 사내 플랫폼 한 곳에서만 약 3만 개의 에이전트가 동시에 일하고 있었습니다. 감시는 두 겹으로 돌아갑니다.
- 실시간 감시: 에이전트 행동의 100%가 실행 전에 검사를 거칩니다. 8월 한 달간 10억 건이 넘는 결정 중 차단된 비율은 0.002%, 약 4만 7,000건에 1건꼴이었습니다. 차단된 행동은 일주일 안에 사람이 다시 봅니다.
- 사후 감시: 기록 전체를 다시 읽어 주당 약 10만 건을 걸러 내고, 그중 우선순위가 가장 높은 주당 약 50건이 사람 검토로 올라갑니다.
개별 에이전트가 말썽을 부리는 일은 드물지만, 수가 많아지면 드문 일도 매일 일어난다는 게 앤트로픽의 설명입니다. 사내에 AI 에이전트를 들이려는 조직이라면 AI 에이전트 보안 체크리스트와 같이 읽어 볼 만합니다.
안전 연구에는 연산을 얼마나 쓰나요?
세 번째 지표는 연산(컴퓨트) 배분입니다. 2026년 7월 13일부터 20일까지 한 주를 잘라 보니, AI 연구개발에 쓴 연산 중 안전 관련 작업은 약 6%였습니다. AI가 주도한 연구개발만 떼어 보면 약 12%로 올라갑니다.
낮아 보이지만 해석은 조심해야 합니다. 안전 연구는 실험 설계에 드는 사람 시간이 길고 연산은 많이 쓰지 않는 성격이라, 연산 비중이 곧 관심의 크기는 아닙니다. 역량과 안전에 반씩 걸친 작업은 안전에서 뺀 보수적 기준이기도 합니다.
이 숫자를 그대로 믿어도 될까요?
앤트로픽 R&D 자동화 지수의 가장 큰 약점은 자체 측정이라는 점입니다. 앤트로픽도 이를 인정하면서 세 가지를 짚었습니다.
- 판정을 자사 모델이 하기 때문에, 평가하는 모델이 평가받는 모델과 같은 실수를 할 수 있습니다.
- 업무 목록을 고정했기 때문에, 사람이 새로 옮겨 간 업무는 지수에 잡히지 않을 수 있습니다.
- 연산 측정은 한 주짜리 스냅숏이라 추세라고 부르기 어렵습니다.
다만 검증 장치도 함께 내놨습니다. 업무 영역을 맡은 직원들이 근거를 보지 않은 상태로 매긴 평가와 비교했더니, 모델과 사람의 정확 일치율은 59%로 사람끼리의 일치율 35%보다 높았고, 한 단계 이내로 좁히면 97%가 맞았습니다. 여기에 여러 기관의 외부 평가자를 회사 안에 상주시키겠다는 계획도 밝혔습니다.
정리
2026년 8월 기준 클로드는 앤트로픽 AI 연구개발의 26%를 주도하고, 90% 넘는 업무에 협업 이상으로 관여하며, 완전 자율 단계는 없습니다. 사내 에이전트는 약 3만 개, 행동 전량이 실시간 감시를 거치고 차단율은 0.002%입니다. 안전 연산 비중은 6%(AI 주도 기준 12%)입니다.
숫자보다 중요한 건 이런 항목을 공개하기 시작했다는 사실일지도 모릅니다. AI 개발 속도조절 논의가 소송까지 번진 지금, 비교 가능한 공개 지표가 있어야 바깥에서도 판단할 수 있습니다. 다음 관전 포인트는 이 수치가 주기적으로 갱신되는지, 다른 연구소가 같은 방식으로 따라오는지입니다.
자주 묻는 질문
앤트로픽 R&D 자동화 지수는 무엇인가요?
앤트로픽이 자사 AI 연구개발을 AI가 얼마나 수행하는지 재려고 만든 시제품 지표입니다. 사내 업무를 378개 항목으로 나눈 뒤 자동화 수준을 0~5단계로 매겨 합산하며, 2026년 9월 17일 처음 공개됐습니다.
클로드가 26%를 주도한다는 게 정확히 무슨 뜻인가요?
2026년 8월 기준 업무의 26%가 AL4 단계라는 뜻입니다. 사람이 큰 지시만 주면 클로드가 대부분을 끝까지 처리하고 사람은 감독만 합니다. 사람 없이 완결하는 AL5 단계는 아직 없습니다.
앤트로픽 사내에는 AI 에이전트가 몇 개나 돌아가나요?
가장 많이 쓰는 사내 플랫폼 기준으로 2026년 8월에 약 3만 개의 에이전트가 동시에 연구·엔지니어링 업무를 하고 있었습니다. 이 플랫폼 한 곳만 집계한 수치입니다.
안전 연구에 쓰는 연산 비중은 얼마나 되나요?
2026년 7월 13~20일 한 주 기준 AI 연구개발 연산의 약 6%, AI가 주도한 연구개발만 보면 약 12%가 안전 작업이었습니다. 경계가 모호한 작업은 뺀 보수적 추정치입니다.
이 숫자를 그대로 믿어도 되나요?
자사 모델로 자사 업무를 평가한 자체 측정이라 한계가 있습니다. 앤트로픽도 판정 모델이 평가 대상과 같은 실수를 할 수 있다고 인정했고, 외부 평가자를 상주시키겠다는 계획을 함께 밝혔습니다.
함께 보면 좋은 글
- AI 속도조절론 담합 소송 총정리: 앤트로픽·오픈AI·구글은 왜 고소당했나 (2026)
- OpenAI 자동 연구 인턴 달성 정리: AI 에이전트가 사람의 3.1배 일하는 시대 (2026)
- KISA AI 에이전트 보안 가이드 개정 발표: 자율 AI 보안 위험과 체크리스트 총정리 (2026)