앤트로픽 R&D 자동화 지수 총정리: 클로드가 자사 AI 연구의 26%를 주도한다 (2026)

Spread the love
앤트로픽 R&D 자동화 지수를 상징하는 주황색 엠블럼과 상승 그래프, AI 채팅 화면이 있는 밝은 사무실 일러스트
이미지: 생성 이미지

앤트로픽 R&D 자동화 지수는 앤트로픽이 자사 AI 연구개발 업무를 AI가 얼마나 대신하고 있는지 측정해 공개한 지표입니다. 2026년 9월 17일 앤트로픽 인스티튜트가 발표한 첫 수치는 이렇습니다. 2026년 8월 기준으로 클로드가 사내 AI 연구개발의 26%를 주도하고, 사람과 협업하는 수준 이상으로 관여하는 비율은 90%를 넘습니다. 다만 사람 없이 완결하는 완전 자율 단계는 아직 없다고 명시했습니다.

AI 회사가 “우리 일을 AI가 얼마나 하는지”를 스스로 숫자로 내놓은 건 이번이 처음에 가깝습니다. 개발 속도를 늦추자는 논의가 한창인 시점이라 더 눈길이 갑니다. 아래에서 지표의 구조와 숫자, 한계까지 정리했습니다.

앤트로픽 R&D 자동화 지수는 어떻게 만들어졌나요?

정식 이름은 앤트로픽 R&D 자동화 지수(Anthropic R&D Automation Index)입니다. 만드는 방식은 생각보다 품이 듭니다.

  1. 2026년 7월 한 달간 매주 모델 개발 부서 인원의 20%를 무작위로 뽑습니다.
  2. 클로드 연구 에이전트가 슬랙과 사내 문서를 읽고 그 사람이 그 주에 한 일을 목록으로 만듭니다.
  3. 이렇게 모인 약 1만 5,000개 세부 업무를 계층 구조로 정리해 542개 노드, 그중 378개 말단 항목으로 고정합니다.
  4. 항목마다 판정 모델이 자동화 수준을 매기고, 투입된 사람 시간을 가중치로 합산합니다.

업무 목록을 고정했다는 점이 중요합니다. 기준이 매번 바뀌면 지수가 올라도 의미를 알 수 없습니다.

26%를 “주도”한다는 건 어느 정도인가요?

자동화 수준은 에포크 AI(Epoch AI)가 제안한 AL0~AL5 척도를 씁니다. 핵심은 AL3과 AL4의 차이입니다.

  • AL3(협업): 사람이 문제와 가설을 어느 정도 정리해 맡깁니다. 중간에 예상 못 한 문제가 나오면 AI가 멈추고 사람이 판단합니다.
  • AL4(주도): 사람은 “이 파이프라인 고쳐줘” 정도만 지시합니다. 로그 확인, 원인 파악, 수정, 검증에 더해 중간 돌발 상황까지 AI가 처리하고 결과를 보고합니다. 배포 결정은 사람 몫입니다.
  • AL5(완전 자율): 사람이 문제를 알려주지 않아도 AI가 스스로 감지하고 배포까지 끝냅니다. 앤트로픽은 이 단계에 도달한 업무는 없다고 밝혔습니다.

즉 26%는 “사람이 안 해도 된다”가 아니라 “사람이 계속 붙어 있지 않아도 된다”에 가깝습니다.

에이전트 3만 개는 누가 감시하나요?

두 번째 지표가 감시 체계입니다. 2026년 8월 기준으로 가장 많이 쓰는 사내 플랫폼 한 곳에서만 약 3만 개의 에이전트가 동시에 일하고 있었습니다. 감시는 두 겹으로 돌아갑니다.

  • 실시간 감시: 에이전트 행동의 100%가 실행 전에 검사를 거칩니다. 8월 한 달간 10억 건이 넘는 결정 중 차단된 비율은 0.002%, 약 4만 7,000건에 1건꼴이었습니다. 차단된 행동은 일주일 안에 사람이 다시 봅니다.
  • 사후 감시: 기록 전체를 다시 읽어 주당 약 10만 건을 걸러 내고, 그중 우선순위가 가장 높은 주당 약 50건이 사람 검토로 올라갑니다.

개별 에이전트가 말썽을 부리는 일은 드물지만, 수가 많아지면 드문 일도 매일 일어난다는 게 앤트로픽의 설명입니다. 사내에 AI 에이전트를 들이려는 조직이라면 AI 에이전트 보안 체크리스트와 같이 읽어 볼 만합니다.

안전 연구에는 연산을 얼마나 쓰나요?

세 번째 지표는 연산(컴퓨트) 배분입니다. 2026년 7월 13일부터 20일까지 한 주를 잘라 보니, AI 연구개발에 쓴 연산 중 안전 관련 작업은 약 6%였습니다. AI가 주도한 연구개발만 떼어 보면 약 12%로 올라갑니다.

낮아 보이지만 해석은 조심해야 합니다. 안전 연구는 실험 설계에 드는 사람 시간이 길고 연산은 많이 쓰지 않는 성격이라, 연산 비중이 곧 관심의 크기는 아닙니다. 역량과 안전에 반씩 걸친 작업은 안전에서 뺀 보수적 기준이기도 합니다.

이 숫자를 그대로 믿어도 될까요?

앤트로픽 R&D 자동화 지수의 가장 큰 약점은 자체 측정이라는 점입니다. 앤트로픽도 이를 인정하면서 세 가지를 짚었습니다.

  1. 판정을 자사 모델이 하기 때문에, 평가하는 모델이 평가받는 모델과 같은 실수를 할 수 있습니다.
  2. 업무 목록을 고정했기 때문에, 사람이 새로 옮겨 간 업무는 지수에 잡히지 않을 수 있습니다.
  3. 연산 측정은 한 주짜리 스냅숏이라 추세라고 부르기 어렵습니다.

다만 검증 장치도 함께 내놨습니다. 업무 영역을 맡은 직원들이 근거를 보지 않은 상태로 매긴 평가와 비교했더니, 모델과 사람의 정확 일치율은 59%로 사람끼리의 일치율 35%보다 높았고, 한 단계 이내로 좁히면 97%가 맞았습니다. 여기에 여러 기관의 외부 평가자를 회사 안에 상주시키겠다는 계획도 밝혔습니다.

정리

2026년 8월 기준 클로드는 앤트로픽 AI 연구개발의 26%를 주도하고, 90% 넘는 업무에 협업 이상으로 관여하며, 완전 자율 단계는 없습니다. 사내 에이전트는 약 3만 개, 행동 전량이 실시간 감시를 거치고 차단율은 0.002%입니다. 안전 연산 비중은 6%(AI 주도 기준 12%)입니다.

숫자보다 중요한 건 이런 항목을 공개하기 시작했다는 사실일지도 모릅니다. AI 개발 속도조절 논의가 소송까지 번진 지금, 비교 가능한 공개 지표가 있어야 바깥에서도 판단할 수 있습니다. 다음 관전 포인트는 이 수치가 주기적으로 갱신되는지, 다른 연구소가 같은 방식으로 따라오는지입니다.

자주 묻는 질문

앤트로픽 R&D 자동화 지수는 무엇인가요?

앤트로픽이 자사 AI 연구개발을 AI가 얼마나 수행하는지 재려고 만든 시제품 지표입니다. 사내 업무를 378개 항목으로 나눈 뒤 자동화 수준을 0~5단계로 매겨 합산하며, 2026년 9월 17일 처음 공개됐습니다.

클로드가 26%를 주도한다는 게 정확히 무슨 뜻인가요?

2026년 8월 기준 업무의 26%가 AL4 단계라는 뜻입니다. 사람이 큰 지시만 주면 클로드가 대부분을 끝까지 처리하고 사람은 감독만 합니다. 사람 없이 완결하는 AL5 단계는 아직 없습니다.

앤트로픽 사내에는 AI 에이전트가 몇 개나 돌아가나요?

가장 많이 쓰는 사내 플랫폼 기준으로 2026년 8월에 약 3만 개의 에이전트가 동시에 연구·엔지니어링 업무를 하고 있었습니다. 이 플랫폼 한 곳만 집계한 수치입니다.

안전 연구에 쓰는 연산 비중은 얼마나 되나요?

2026년 7월 13~20일 한 주 기준 AI 연구개발 연산의 약 6%, AI가 주도한 연구개발만 보면 약 12%가 안전 작업이었습니다. 경계가 모호한 작업은 뺀 보수적 추정치입니다.

이 숫자를 그대로 믿어도 되나요?

자사 모델로 자사 업무를 평가한 자체 측정이라 한계가 있습니다. 앤트로픽도 판정 모델이 평가 대상과 같은 실수를 할 수 있다고 인정했고, 외부 평가자를 상주시키겠다는 계획을 함께 밝혔습니다.

함께 보면 좋은 글

출처

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤