Google Antigravity는 93개 하위 agent를 활용해 운영체제 커널을 처음부터 만들고, 그 위에서 DOOM을 실행했습니다. 작업에는 12시간이 걸렸고 26억 token이 처리됐으며, API 크레딧 지출은 $1,000 미만이었습니다. 이 사례의 핵심은 여러 코딩 agent가 긴 작업을 나눠 수행했다는 점입니다. 다만 DOOM 실행이라는 성과와 커널 전체의 완성도는 구분해서 봐야 합니다.
12시간 동안 무엇이 투입됐나
agent(목표에 따라 작업을 계획하고 도구를 사용하는 AI 실행 단위)는 이 실험에서 한 명처럼 움직이지 않았습니다. Google Antigravity에서 Gemini 3.5 Flash로 동작하는 주도 agent가 93개 하위 agent를 이끌며 커널 제작 작업을 진행했습니다. 사람은 코드를 직접 작성하지 않았고, 완성된 커널에서 원작 DOOM을 실행해 플레이하는 모습은 Google I/O에서 시연됐습니다.
| 항목 | 기록 |
|---|---|
| 하위 agent | 93개 |
| 작업 시간 | 12시간 |
| 모델 요청 | 1만 5,000회 이상 |
| 처리량 | 26억 token |
| 지출 | API 크레딧 $1,000 미만 |
여기서 token은 모델이 처리하는 내용의 단위입니다. 26억 token은 단일 답변의 길이가 아니라, 수많은 모델 요청에 걸쳐 처리된 총량입니다. 또 $1,000 미만이라는 수치는 API 크레딧 지출을 가리킵니다. 이 금액을 모든 개발 비용이나 누구나 같은 조건에서 얻을 수 있는 가격으로 받아들여서는 안 됩니다.

▲ 하위 agent의 병렬 작업
숫자의 의미는 작업 규모에 있습니다. 커널 제작처럼 오래 걸리는 목표를 하나의 agent에 순서대로 맡기기보다, 여러 실행 단위에 나눠 병렬로 다룬 사례입니다. 반면 93개라는 수치만으로 각 agent가 맡은 작업의 난도나 기여도를 알 수는 없습니다.
agent 팀은 어떻게 움직이나
Google Antigravity에서는 /team 명령으로 팀 작업을 시작할 수 있습니다. 주도하는 agent가 요청을 검토하고, 필요한 조건이 빠졌다면 확인한 뒤 역할별 하위 agent를 구성합니다. 하위 agent는 분리된 작업 공간과 격리된 실행 환경에서 병렬로 일할 수 있습니다. 사용자는 각 작업의 진행 상황을 요청에 맞춰 만들어지는 generative UI(필요한 정보를 보여주도록 즉석에서 구성하는 사용자 인터페이스)로 살펴볼 수 있습니다.
이 구조는 작업을 잘게 나누는 것에서 끝나지 않습니다. 주도하는 agent가 어떤 일을 위임하고 결과를 어떻게 모을지 결정해야 합니다. Google DeepMind 내부의 별도 모델 평가 작업에서는 성능 차이를 설명할 가설 약 100개를 만들고, 가설마다 하위 agent를 배정해 조사했습니다. 이는 병렬 조정 방식의 또 다른 사례이지만, DOOM 커널의 품질을 입증하는 자료는 아닙니다.
커널 실험에서도 여러 agent가 동원됐다는 점은 확인됩니다. 그러나 알려진 기록만으로는 93개 하위 agent 각각의 담당 범위, 코드 통합 과정, 오류를 해결한 횟수를 구분할 수 없습니다. 팀 구성 방식은 이해할 수 있어도, 실제 커널 제작의 세부 경로까지 복원할 수 있는 것은 아닙니다.
DOOM 실행이 증명하는 범위
DOOM을 커널에서 실행하고 플레이했다는 사실은 결과물이 특정 목표를 달성했다는 근거입니다. 단순히 코드를 작성하거나 실행 계획만 만든 사례와는 다릅니다. 12시간 동안 이어진 다중 agent 작업이 작동하는 결과로 연결됐다는 점에서 의미가 있습니다.

▲ 실행 성공과 검증 범위
다만 이 성공 기준을 커널의 전반적인 완성도와 동일하게 놓을 수는 없습니다. DOOM 실행만으로는 다른 프로그램을 돌렸을 때의 동작이나 커널 기능별 테스트 결과까지 알 수 없습니다. 따라서 확인할 수 있는 결론은 ‘DOOM을 실행하는 커널을 만들었다’는 것이지, 범용 운영체제 커널로서 필요한 기능을 모두 갖췄다는 것은 아닙니다.
재현 가능성도 별개의 문제입니다. 같은 목표를 다시 수행해 비슷한 결과를 얻을 수 있는지 판단하려면 사용한 지시, 실행 환경, 빌드 절차와 검증 기록을 확인해야 합니다. 한 차례의 실행 결과와 총량 수치만으로는 동일 조건의 반복 실험 결과를 판단하기 어렵습니다. API 크레딧 지출 역시 이 한 차례 실험의 기록으로 읽는 편이 정확합니다.
결과를 어떻게 활용할까
이 사례는 빠른 모델과 병렬 하위 agent를 결합하면 긴 코딩 작업에서 어디까지 도달할 수 있는지 보여줍니다. Google Antigravity 팀은 이 결과를 긴 agent 작업이 지금도 경제적으로 가능하다는 근거로 봅니다. 다만 커널을 매일 수백~수천 달러를 들여 만드는 것은 아직 현실적이지 않고, 작업 분해·협업·오류 처리에서도 다중 agent 시스템이 개선할 여지가 크다고 인정합니다.
또한 결과물이 한 가지 목표를 수행했다는 사실, 소요 자원의 기록, 다른 사람이 반복할 수 있는 절차는 서로 다른 종류의 근거라는 점도 드러납니다.
비슷한 agent 팀 작업을 계획한다면 먼저 실행 가능한 목표와 확인 방법을 분명히 정해야 합니다. 이어 주도하는 agent에 작업 조건을 구체적으로 전달하고, 하위 작업의 진행뿐 아니라 최종 결과를 검증할 자료도 남겨야 합니다. DOOM 커널 사례에서 확인된 성과는 실행 성공입니다. 완성도와 재현 가능성을 평가하려면 그보다 더 자세한 검증 기록이 필요합니다.