Google이 9월 30일 공개한 Gemini 4 Argon은 기업의 지식 업무, 소프트웨어 개발, 사이버 보안 방어에서 최고 수준의 성능을 내세운 모델입니다. 발표는 Google DeepMind 수석 부사장이자 Google의 최고 AI 설계 책임자인 Koray Kavukcuoglu가 맡았습니다. 공개된 성능표를 보면 업무와 자동화 지표에서는 경쟁 모델을 뚜렷하게 앞서지만, 모든 지표에서 앞서는 것은 아닙니다. 게다가 지금은 일반 개발자와 사용자가 직접 써 볼 수 없어, 성능표의 수치는 대부분 Google의 자체 발표입니다. 성능표에서 앞선 곳과 뒤진 곳, 출력 한도와 가격, Google 내부에서 먼저 쓴 결과를 차례로 정리합니다.
성능표: 업무 agent는 앞서고 코딩은 혼전
Google이 공개한 표에서 Gemini 4 Argon은 GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5와 비교됐습니다.
| 지표 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index(지식 업무) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey 법률 agent 지표 | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Terminal-Bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
지식 업무, 업무 자동화, 금융 분석, 법률 업무처럼 agent(스스로 여러 단계를 처리하는 AI)가 실제 업무를 맡는 지표에서는 차이가 큽니다. 법률 agent 지표는 다른 모델이 3.8~6.7%에 머무는 사이 19.6%를 기록했습니다. 반면 코딩은 엇갈립니다. DeepSWE v1.1과 Vibe Code Bench에서는 앞섰지만, FrontierSWE v2에서는 GPT-6 Astra에, 터미널 작업을 보는 Terminal-Bench 4.0에서는 Claude Opus 5.5에 뒤졌습니다. 완승이라기보다 최상위 모델들과 대등한 자리에 올라선 결과로 보는 편이 정확합니다.
독립 평가 기관 Artificial Analysis의 평가에서도 높은 추론 설정의 Argon은 업무 자동화 지표 AutomationBench-AA에서 78%로 1위를 기록했고, Terminal-Bench 4.0에서는 52%로 최상위권에 올랐습니다. 특정 지표에 맞춰 점수만 끌어올렸다기보다 전반적인 능력이 좋아진 결과로 보입니다.
출력 100만 token과 도입 가격
한 번에 생성할 수 있는 출력은 최대 100만 token(모델이 처리하는 글 조각 단위)으로, 이전 한도 6만 4,000 token의 16배입니다. 출력 한도는 모델이 한 번에 읽을 수 있는 입력의 범위나 여러 세션에 걸친 기억과는 다른 개념입니다. 긴 추론이나 여러 파일에 걸친 대규모 코드를 한 번에 만들어 내는 데 의미가 있습니다.
가격은 입력 100만 token당 $2, 출력 100만 token당 $10로 시작하고, 캐시에서 다시 읽는 입력은 95% 할인됩니다. 다만 도입 가격이라 이 수준이 오래 유지되지 않을 수 있습니다.

▲ 늘어난 출력 한도
Google 안에서 먼저 쓴 결과
Google 안에서는 이미 엔지니어 수천 명이 개발과 연구에 Argon을 쓰고 있습니다. Google이 밝힌 사례는 다음과 같습니다.
- 양자 컴퓨팅 알고리즘의 큐비트와 게이트 자원 최적화에서 40분 만에 기존에 발표된 기준보다 40% 나은 결과를 냈습니다.
- 데이터센터 전체의 성능 측정 기록을 분석해 300TiB가 넘는 메모리를 확보했고, 최적화가 모두 반영되면 500TiB에서 1PiB까지 줄일 수 있을 것으로 내다봤습니다. 데이터센터 규모에서는 작은 최적화도 큰 비용 절감으로 이어집니다.
- C와 C++로 된 코드를 메모리 안전성이 높은 Rust로 옮기는 작업을 맡겨, 운영체제 Fuchsia의 Zircon 커널에서 80만 줄이 넘는 코드를 옮겼습니다.
- Google의 오픈소스 영상 디코더 libgav1에서는 기존 Rust 이식본을 검토해 SIMD 코드 3만 2,000줄을 대체했습니다. 같은 영상을 출력하면서 이전 이식본보다 2.7배 빨라졌습니다.
libgav1 작업의 방식이 눈여겨볼 만합니다. agent들이 성능 측정을 바탕으로 실험을 거듭하며 컴파일러 출력을 살폈고, 컴파일러가 자동 벡터화(여러 데이터를 한 번에 처리하는 명령으로 바꾸는 최적화)를 할 수 있도록 Rust 코드를 다듬었습니다. 가설을 세우고 측정 가능한 지표로 시험한 뒤 개선을 반영하는 과정을 쉬지 않고 되풀이하는 방식으로, Andrej Karpathy가 말한 자동 연구 방식과 닮았습니다. 다만 이 사례들은 Google이 고른 성공 사례이므로, 수많은 시도 가운데 잘된 경우만 골랐을 가능성도 염두에 둘 필요가 있습니다.

▲ 실험을 되풀이하는 코드 최적화
아직 직접 써 볼 수 없는 이유
Argon은 단계적으로 공개됩니다. 지금은 Google의 Fairwind Program에 참여한 신뢰할 수 있는 사이버 보안 방어 기관만 쓸 수 있고, 이 순서는 미국 정부의 출시 전 모델 접근 절차와 맞춰 진행됩니다. 다음 순서는 Ultra 요금제의 유료 API 이용자이며, 개별 개발자와 일반 사용자는 아직 써 볼 수 없습니다.
이 때문에 Google이 발표한 성능표를 일반 개발자가 직접 확인할 수는 아직 없습니다. 초기 지표는 좋아 보이지만, Gemini 4가 실제로 얼마나 나은지는 여러 사람이 직접 써 본 결과가 쌓인 뒤에야 판단할 수 있습니다.
지금 확인할 점
Gemini 4 Argon은 업무 자동화와 지식 업무에서 강점을 보이며 Google을 최상위 경쟁에 다시 올려놓았지만, 코딩에서는 경쟁 모델과 우열을 다투는 수준입니다. 접근이 열리기 전에 다음을 준비해 두면 좋습니다.
- 업무 자동화, 금융 분석, 법률 문서처럼 지표가 크게 앞선 작업을 먼저 시험할 후보로 정합니다.
- 터미널에서 일하는 코딩 agent에 쓸 생각이라면 Claude Opus 5.5, GPT-6 Astra와 같은 과제로 비교할 계획을 세웁니다.
- 발표 수치는 자체 결과이므로 접근이 열리면 자신의 실제 작업으로 다시 확인합니다.
- 입력 100만 token당 $2라는 가격은 도입 가격이므로 비용 계획에 여유를 둡니다.
- 대규모 코드 생성처럼 출력이 길게 필요한 작업이 있는지 미리 정리해 둡니다.