Google이 9월 30일 Gemini 4 Argon을 발표하며 여러 평가 항목에서 경쟁 모델을 앞서는 성능표를 내놓았지만, 지금은 지정된 사이버 보안 방어 인력만 이 모델을 쓸 수 있습니다. 같은 시기 OpenAI는 개인 agent(사용자를 대신해 여러 단계의 일을 처리하는 AI) 플랫폼 Dots를 ChatGPT 안에 넣었고, Anthropic은 Argon과 같은 가격의 Claude Sonnet 5.5를 내놓았습니다. 이런 흐름을 보면 경쟁의 초점은 성능표의 점수보다 agent가 도구를 얼마나 믿을 만하게 다루는지, 그리고 사용자가 매일 일하는 앱이 어디인지로 옮겨 가고 있다고 볼 수 있습니다. Google이 Argon으로 개발자들의 관심을 되찾으려면 이 두 가지 숙제를 풀어야 할 것으로 보입니다.
소수에게 먼저 열린 Argon, 성능은 아직 확인 전
Google이 공개한 성능표만 보면 Argon은 경쟁 모델보다 앞서 있습니다. 하지만 지정된 보안 방어 인력에게만 먼저 열려 있어, 그 수치가 실제 업무에서도 이어지는지 외부에서 확인하기 어렵습니다. 최고 모델을 소수에게 먼저 여는 방식에서는 일반 사용자가 발표된 수치를 그대로 받아들이기보다 공개 이후의 사용 경험을 기다리는 편이 낫습니다.
신중하게 볼 이유는 과거에도 있었습니다. Gemini 3와 Gemini 3.1도 성능표에서는 뛰어나 보였지만, 일상적인 업무에서는 사용자의 기대에 미치지 못했습니다. 그래서 Argon도 공개된 뒤 실제로 오래 써 본 결과로 판단하는 편이 안전합니다.
가격은 경쟁력이 있습니다. Argon의 도입 가격은 입력 100만 token(모델이 글을 처리하는 단위)당 $2, 출력 100만 token당 $10로, Claude Sonnet 5.5와 같습니다.
| 모델 | 입력(100만 token당) | 출력(100만 token당) |
|---|---|---|
| Gemini 4 Argon | $2 | $10 |
| Claude Sonnet 5.5 | $2 | $10 |
| Claude Opus 5.5 | $4 | $20 |
Claude Sonnet 5.5는 Claude Opus 5.5의 절반 가격이면서 agent 코딩 benchmark(모델 성능을 비교하는 시험)인 Terminal-Bench 4.0에서 70.6%로 Opus 5.5(64.4%)를 앞섰습니다. Argon이 이 가격에 정말 최상위 성능을 낸다면 합리적인 선택지가 되겠지만, 같은 가격대에 이미 강한 상대가 있다는 뜻이기도 합니다.
Gemini가 풀어야 할 숙제, 도구 호출
Gemini가 마지막으로 경쟁력 있는 모델을 내놓은 때는 2026년 1월의 Gemini 3로 볼 수 있습니다. Gemini 3는 웹 화면 같은 프런트엔드 코드를 만드는 데는 강했지만, 도구 호출(모델이 외부 도구를 불러 작업을 처리하는 기능)이 약했습니다. 도구 호출이 약하면 스스로 일을 처리하는 agent를 만들기 어려워, 이 약점은 큰 걸림돌이 됐습니다. Google의 AI 코딩 도구 Antigravity가 널리 쓰이지 못한 것도 개발자와 창업자들이 그 바탕의 Gemini 모델을 매일 하는 업무에 믿고 쓰기 어렵다고 느꼈기 때문으로 보입니다.
분명한 강점도 있습니다. Gemini는 영상을 직접 입력받아 한 편을 10초 안팎에 받아들이고 깊이 분석할 수 있는데, 다른 최상위 모델은 이를 따라오지 못합니다. 다만 이 강점만으로는 부족했습니다. 2026년 들어 Google은 창업자나 숙련된 지식 노동자가 매일 의지할 만한 모델을 아직 내놓지 못한 것으로 보입니다.

▲ agent의 도구 호출
agent가 머무는 앱이 승부처
경쟁사들은 각자의 앱을 agent가 일하는 중심 자리로 삼고 있습니다. OpenAI의 Dots는 ChatGPT 데스크톱 앱에 바로 들어가 있습니다. ChatGPT 휴대전화 앱에서 음성 통화로 Dots에게 일을 맡기면, Dots가 Slack과 이메일로 동료에게 소식을 전하고 필요하면 OpenAI의 코딩 도구 Codex의 작업 세션을 열어 웹페이지 시안을 만드는 식입니다. Dots를 움직이는 빠른 모델은 Codex나 GPT 모델에 일을 넘기기 전까지는 요금제 사용량을 쓰지 않습니다. 함께 나온 ChatGPT Space에서는 사람과 agent가 같은 문서를 함께 고칩니다.
Anthropic은 Claude의 Projects에서 주 agent가 작업마다 별도의 대화 흐름을 열어 여러 일을 동시에 처리하게 했고, 이 흐름은 클라우드와 사용자의 Mac 어느 쪽에서도 돌릴 수 있습니다. ChatGPT와 Claude뿐 아니라 GrokBot과 Cursor도 전용 데스크톱 앱을 갖추고 있습니다.
반면 Google의 AI 기능은 Antigravity, Gemini 앱, Google AI Studio, NotebookLM으로 흩어져 있어, 새 모델이 나와도 어디서 써야 하는지가 분명하지 않습니다. OpenAI가 ChatGPT 데스크톱 앱을 우선해, 새 모델이 나올 때마다 사용자에게 분명한 사용 환경을 제공해 온 것과 대비됩니다. Google이 기능을 한곳으로 모은 앱을 내놓지 못하면, Argon의 성능이 좋아도 사용자가 머물 이유를 만들기 어려울 수 있습니다.

▲ 하나로 모은 앱과 흩어진 도구
지금 할 일
Gemini 4 Argon은 반가운 경쟁자이지만, 성능표만 보고 기대하기보다 신중하게 지켜볼 대상입니다. 다음을 기준으로 판단하면 좋습니다.
- 새 모델은 회사가 낸 성능표보다 자신의 업무로 꾸준히 써 본 결과로 평가합니다.
- Argon이 공개되면 도구 호출이 필요한 agent 작업부터 시험해 이전 Gemini의 약점이 고쳐졌는지 확인합니다.
- 영상을 빠르게 분석해야 하는 작업이라면 지금도 Gemini의 강점을 활용할 수 있습니다.
- agent 도구는 모델 점수만이 아니라 자신이 매일 일하는 앱과 얼마나 잘 이어지는지로 고릅니다.
- 같은 가격대인 Claude Sonnet 5.5와 비용 대비 성능을 직접 비교할 준비를 해 둡니다.