GPT-6 Astra 벤치마크 분석: ARC-AGI-3 99.9%와 AGI 선언의 진실 (2026)

Spread the love
GPT-6 Astra AI 모델 벤치마크 분석 개념 이미지

OpenAI가 9월 3일 GPT-6 Astra를 공개하면서 “AGI 시대에 들어섰다”고 선언했습니다. ARC-AGI-3에서 99.9%, FrontierMath Tier 4에서 97.6%, ExploitBench에서 100%라는 숫자가 쏟아졌습니다. 하지만 이 숫자들을 그대로 받아들여도 될까요?

이 글에서는 GPT-6 Astra의 벤치마크 점수를 하나씩 뜯어보고, 숫자 뒤에 숨은 조건과 한계를 정리합니다. 실제로 무엇이 달라졌고, 무엇은 아직 과장인지 확인해 보겠습니다.

GPT-6 Astra, 어떤 모델인가

GPT-6 Astra는 GPT-5.6 Sol의 후속 플래그십 모델입니다. OpenAI는 이 모델을 “추론, 컴퓨터 사용, 에이전트 작업”에 특화된 차세대 모델로 포지셔닝했습니다.

컨텍스트 윈도우가 Sol의 20만 토큰에서 105만 토큰으로 5배 이상 늘었습니다. 출력 제한도 12만 8천 토큰으로 확대됐습니다. 사이버 보안 고객에게 먼저 제공되고, 이후 ChatGPT Plus, Pro, Business, Enterprise 사용자와 API 개발자에게 순차 확대됩니다. 무료 사용자는 이용할 수 없습니다.

올여름 OpenAI가 테스트 중이던 모델 두 개가 허깅페이스 보안 침해 사고에 연루된 뒤, Astra는 더 강화된 안전 장치를 적용해 개발됐습니다. Astra 자체는 해당 사고에 관여하지 않았다고 OpenAI는 밝혔습니다.

📊 벤치마크 점수 총정리

OpenAI가 공개한 주요 벤치마크 결과를 GPT-5.6 Sol, Claude Fable 5.1과 비교하면 다음과 같습니다.

벤치마크 GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
GPQA Diamond (대학원 수준 과학) 96.0% 94.6% 93.7%
FrontierMath Tier 4 (연구급 수학) 97.6% 83.0%
ARC-AGI-3 (에이전트 추론, 어댑터) 99.9% 7.8%
ARC-AGI-3 (표준 API) 62.7% 7.8%
ExploitBench (사이버 보안) 100% 78.5%
OSWorld 2.0 (컴퓨터 사용) 72.6% 65.7%
DeepSWE v1.1 (소프트웨어 엔지니어링) 74.1%
Terminal-Bench Science 0.1 64.6% 22.4% 52.6%
Agents’ Last Exam (전문 에이전트) 59.3% 53.6%

FrontierMath에서 83%→97.6%로 뛴 것과 Terminal-Bench Science에서 22.4%→64.6%로 3배 가까이 오른 점은 확실한 진전입니다. 하지만 GPQA Diamond에서는 94.6%→96.0%로, 이미 수렴한 벤치마크에서 1.4점 차이에 불과합니다.

🔍 ARC-AGI-3 99.9%의 숨겨진 조건

가장 눈에 띄는 숫자는 ARC-AGI-3의 99.9%입니다. 하지만 여기에는 중요한 별표가 붙습니다.

같은 모델, 같은 테스트에서 표준 API 호출 시 62.7%, OpenAI의 Provider Adapter 하네스를 사용하면 99.9%입니다. 37점 격차입니다. ARC Prize 재단이 직접 검증한 결과에서도 이 차이가 확인됐습니다.

Provider Adapter는 턴 사이에 추론 상태를 유지하는 OpenAI의 독자적 스캐폴딩입니다. 속임수는 아닙니다. 실제 플랫폼 기능이긴 합니다. 하지만 99.9%라는 숫자는 “모델 + OpenAI 전용 인프라”를 합친 성적이지, 다른 서비스에서 동일하게 재현할 수 있는 수치가 아닙니다.

ARC Prize 재단 역시 “벤치마크를 포화시키는 것이 AGI 달성을 증명하지는 않는다”고 명확히 밝혔습니다. 다만 “Astra가 프론티어 모델 능력에서 의미 있는 단계 변화(step-function change)를 보여준다”는 평가도 함께 내놓았습니다.

🖥️ 진짜 달라진 것: 컴퓨터 사용 능력

Astra에서 가장 실질적인 발전은 컴퓨터 사용(Computer Use) 능력입니다.

  • OSWorld 2.0: 72.6% (Sol 대비 약 7점 상승), 작업당 소요 시간 47% 단축
  • ScreenSpot-Pro: 92.7%로 화면 요소 인식 정확도 최고 수준
  • Agents’ Last Exam: 59.3%로 금융 모델링, 엔지니어링, 미디어 제작 등 복잡한 전문 소프트웨어 작업에서 1위

OpenAI는 “Astra로 아파트 구하기를 6시간에서 10분 이하로 줄일 수 있다”고 예시를 들었습니다. 웹사이트 제작, 과학 분석, 게임 개발, 사이버 보안, 코딩까지 자율적으로 처리할 수 있다는 것이 공식 설명입니다.

Artificial Analysis의 코딩 에이전트 인덱스에서 Astra는 67점으로, Claude Opus 5, Fable 5와 동등하면서 작업당 비용은 절반 이하입니다. 다만 Fable 5.1이 70점으로 여전히 코딩 분야 1위를 지키고 있습니다.

🤔 AGI 선언, 진짜일까

OpenAI 사장 Greg Brockman은 “우리가 지금 AGI 시대에 있다고 느끼는 것이 합리적”이라고 말했습니다. 동시에 수석 과학자 Jakub Pachocki는 “모델이 목표 달성에 매우 능숙해질 수 있지만, 여전히 사용자의 의도와 다르게 행동할 수 있다”고 경고했습니다.

Epoch AI의 종합 능력 지수(Capabilities Index)에서 Astra는 역대 최고점을 기록했고, 미해결 에르되시 수학 문제 2개를 풀어내기도 했습니다. 이는 시험 문제가 아니라 학계에서 아직 해결하지 못한 연구 과제라는 점에서 의미가 있습니다.

하지만 Artificial Analysis의 Intelligence Index에서는 61점으로, Sol과 동점이고 Claude Fable 5.1(65.7점)보다 5점 낮습니다. 가격은 Sol 대비 2.5배 비싸졌고, 일부 평가에서는 오히려 2~3점 하락한 항목(금융 고객지원, 장문 추론)도 있습니다.

AGI라는 표현은 OpenAI의 마케팅 메시지입니다. 특정 벤치마크에서 인간 수준을 넘는 것과 모든 지적 과제에서 범용적으로 인간과 동등한 것은 다릅니다.

누가 써야 하고, 누가 기다려야 할까

쓸 만한 경우: 에이전트 코딩, 브라우저/컴퓨터 자동화, 승인된 보안 연구, 대규모 과학 분석처럼 장시간 자율 작업이 필요한 영역. Terminal-Bench, OSWorld, ExploitBench에서 Sol 대비 큰 폭으로 앞서기 때문입니다.

기다려도 되는 경우: 일상 대화, 짧은 텍스트 작업, 일반 코딩. Intelligence Index에서 Sol과 차이가 없고, 가격이 2.5배라 비용 대비 효과가 떨어집니다. SWE-bench Verified, MMLU-Pro 같은 주요 벤치마크 점수도 아직 미공개입니다.

정리

GPT-6 Astra는 컴퓨터 사용과 에이전트 작업에서 확실한 세대 변화를 보여줍니다. FrontierMath와 Terminal-Bench Science에서의 도약은 인상적입니다. 하지만 ARC-AGI-3 99.9%는 전용 하네스 조건에서만 나오는 수치이고, 범용 지능 지수에서는 전작과 동점입니다. “AGI 시대”라는 선언은 아직 벤치마크 결과 이상의 근거가 필요합니다.

모든 AI 모델이 그렇듯, 숫자보다 중요한 것은 실제 사용 경험입니다. Astra가 정말 게임 체인저인지는 앞으로 몇 주간의 현장 피드백이 결정할 것입니다.

함께 보면 좋은 글

출처

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤