새 모델의 승부처가 품질에서 효율로 옮겨가고 있습니다. GPT-6 Sol은 3D 절차적 장면 생성 과제에서 이전 세대인 GPT-5.6 Sol과 완전히 같은 prompt를 최대 추론 설정으로 실행했을 때, 결과물의 완성도는 앞서면서 생성 시간을 60~80% 줄였습니다. token을 오히려 더 쓴 과제에서도 대기 시간은 절반 안팎으로 줄었고, 절반 이하로 떨어진 과제도 여럿 있었습니다. 모델 교체를 검토할 때 품질 점수보다 작업당 비용과 대기 시간을 먼저 확인해야 한다는 판단으로 이어지는 대목입니다.

같은 prompt, 최대 추론이라는 조건

OpenAI의 모델 등급은 Luna, Terra, Sol, Astra로 나뉩니다. GPT-6 Astra가 최상위 플래그십으로 먼저 공개됐고, 그 아래 등급인 GPT-6 Sol이 뒤이어 채워지는 순서입니다. 등급 이름만으로는 위계가 잘 드러나지 않아 사용자가 관계를 따라가기 어렵다는 지적도 함께 나옵니다.

비교 기준은 세 가지입니다. 생성 품질, 캐시 token을 포함한 총 token 사용량, 실제로 흘러간 소요 시간입니다. 과제는 3D 절차적 웹 장면 생성입니다. 예를 들어 금문교 장면에 안개 농도와 시간대, 차량 통행 밀도를 조절하는 슬라이더를 붙이고 실시간으로 반영되게 만드는 식입니다. 이런 과제는 코드 합성 능력, 여러 단계를 잇는 코드 오케스트레이션, 공간 이해, UI 컨트롤과 렌더링 상태의 연결을 한 번에 요구합니다.

금문교 과제에서 GPT-5.6 Sol은 940만 token을 쓰고 1시간 4분이 걸려 평이하고 밋밋한 장면을 냈습니다. GPT-6 Sol은 470만 token, 11분 35초로 끝냈습니다. 다리 구조가 깔끔해지고 물 반사와 조명이 사실적으로 바뀌었으며 대기 관련 슬라이더도 즉각 반응했습니다.

작업대 위에 격자로 놓인 여러 3D 장면 모형과 모래시계

▲ 과제별 소요 시간 비교

시간이 줄어든 폭이 token보다 큰 과제

같은 조건으로 돌린 여러 과제의 수치를 모으면 시간 격차가 token 격차보다 훨씬 큽니다. 먼저 token과 시간이 함께 줄어든 과제들입니다.

과제 GPT-5.6 Sol GPT-6 Sol
금문교 940만 token / 1시간 4분 470만 token / 11분 35초
카파도키아 열기구 1310만 token / 53분 52초 400만 token / 9분 58초
스톤헨지 950만 token / 53분 49초 350만 token / 11분 42초
대왕문어 780만 token / 48분 39초 660만 token / 9분 51초
브룩스 폭포 불곰 1000만 token / 53분 46초 420만 token / 9분 31초
대피라미드 790만 token / 46분 22초 530만 token / 11분 38초
이스탄불 1300만 token / 1시간 2분 730만 token / 19분 59초

품질 차이도 뚜렷했습니다. 카파도키아 과제에서 GPT-5.6 Sol은 버섯 모양 암봉이 있는 투박한 지형에 그쳤지만, GPT-6 Sol은 정교한 버섯바위와 떠 있는 열기구를 갖춘 풍경을 만들었습니다. 스톤헨지에서는 GPT-5.6 Sol이 각진 돌기둥과 어긋난 그림자를 냈고, GPT-6 Sol은 자연스러운 원형 배치와 사실적인 돌 질감을 구현했습니다. 이스탄불 장면은 지형이 잘리는 문제 없이 모스크와 다리가 선명하게 표현됐습니다. 다만 최상위 모델인 GPT-6 Astra나 Claude Fable 5.1 수준의 사실적 완성도에는 이르지 못합니다.

token을 오히려 더 쓴 과제에서도 시간은 줄었습니다.

과제 GPT-5.6 Sol GPT-6 Sol
모네 수련 940만 token / 47분 15초 1710만 token / 25분 26초
반 고흐 마을 640만 token / 54분 5초 890만 token / 28분 3초
템스강 역사 장면 480만 token / 44분 3초 640만 token / 14분 59초
바벨탑 930만 token / 50분 10초 2030만 token / 24분 28초
빗속의 정원 460만 token / 48분 46초 690만 token / 14분 16초
맨해튼 항공 장면 700만 token / 1시간 41분 2420만 token / 44분 24초

줄어든 폭은 과제마다 다릅니다. 모네 수련은 47분 15초에서 25분 26초로, 반 고흐 마을은 54분 5초에서 28분 3초로 절반을 조금 넘는 수준까지 내려갔습니다. 반면 템스강 역사 장면은 3분의 1 수준으로, 빗속의 정원은 30% 아래로 줄었습니다. 맨해튼 항공 장면도 1시간 41분에서 44분 24초로 절반 이하가 됐습니다.

품질 격차도 컸습니다. 모네 수련 과제에서 GPT-5.6 Sol은 픽셀이 뭉개진 평면 타일과 떠 있는 검은 상자를 내놓아 원작의 분위기를 살리지 못했습니다. GPT-6 Sol은 수련 잎과 아치형 나무다리 반사, 늘어진 버드나무 실루엣이 있는 회화적 3D 공간을 만들었습니다. 바벨탑도 GPT-5.6 Sol은 어두운 단순 탑에 그쳤지만 GPT-6 Sol은 햇빛이 드는 정교한 벽돌 구조물을 세웠습니다. 즉 늘어난 token은 빈 코드 검증에 낭비된 것이 아니라 복잡한 절차적 형상을 만드는 데 쓰였습니다. 맨해튼 장면에서는 센트럴파크 수목, 수로, 격자형 도로 배치가 살아 있었습니다.

token이 적다고 빠른 게 아니다

대왕문어 과제에서 두 모델의 token 차이는 780만 대 660만으로 크지 않았는데 걸린 시간은 48분 39초 대 9분 51초로 약 5배 차이였습니다. token 수가 실행 속도를 결정하지 않는다는 뜻입니다. 이전 세대 추론 모델은 반복 테스트와 재검증, 자기 점검 루프에 벽시계 시간을 대량으로 쏟는 경향이 있는 것으로 보입니다. 출력 token이 비례해 늘지 않아도 시간은 계속 흘러갑니다. 배경색 같은 기본 시각 파라미터 하나를 확인하려고 45분씩 내부 테스트를 작성하는 것은 사용자 입장에서 납득하기 어려운 지연입니다. 반면 GPT-6 Sol은 같은 조건에서 망설임이 줄고 결과를 확신 있게 마무리합니다.

동전 더미와 스톱워치가 놓인 책상, 뒤편의 노트북

▲ 작업당 비용과 대기 시간

작업당 비용이 바꾸는 판단

agent 작업 성능을 비용과 함께 비교한 리더보드를 보면 성능과 비용의 관계가 드러납니다.

모델 작업당 중간 비용 순 개선 점수
Claude Fable 5.1 (Max) $4.40 +13.7%
GPT-6 Astra (Max) $3.94 +12.7%
Claude Opus 5 (High) $2.07 +10.3%
GPT-5.6 Sol (High) $1.03 +8.0%

최상위 모델은 성능이 앞서지만 작업 한 건에 $4 안팎이 듭니다. 고급 모델 구독자들이 월간 사용 한도나 크레딧을 30분 만에 소진하는 일이 잦다는 이야기도 이런 구조에서 나옵니다. GPT-6 Sol이 Claude Opus 5에 근접한 성능을 작업당 40센트 수준에 제공한다면 비용 대비 성능의 계산이 크게 달라집니다. 다만 이 비용은 검증된 리더보드 값이 아니라 추정치라는 점은 분명히 해둘 필요가 있습니다. token 수와 실행 시간이 함께 줄면 Gemini 3.8 Flash나 DeepSeek V4.1 Flash 같은 경량 모델의 비용 대역에 가까워지면서도 frontier급 추론 품질을 유지하는 셈이 됩니다.

추론 설정을 낮춰도 되는 이유

가장 실용적인 조언은 추론 강도를 습관적으로 최대로 두지 말라는 것입니다. 최대 설정은 시간과 비용이 급격히 늘어나는 데 비해 품질 향상이 그에 비례하지 않습니다. 기본 모델 자체가 더 똑똑해졌기 때문에 낮음이나 중간 설정에서도 충분히 높은 품질을 얻습니다. 두 모델을 모두 최대 추론으로 돌린 혹등고래 장면에서도 기본 모델의 차이가 드러납니다. GPT-5.6 Sol은 560만 token을 들여 42분 48초 만에 정적인 모형을 냈지만, GPT-6 Sol은 660만 token으로 14분 30초 만에 물보라와 도약 동작이 살아 있는 결과를 만들었습니다. 여러 차례 대화가 이어지는 환경에서는 비싼 추론 token이 누적되어 비용이 눈덩이처럼 커집니다. frontier 아키텍처를 낮은 추론 설정으로 돌리는 편이 가장 비용 효율적인 개발 전략이라는 정리로 이어집니다.

정리: 모델 교체 판단 기준

GPT-6 Sol은 느리고 비효율적인 완전 탐색 검증 단계에서 빠르고 비용 효율적인 agent 지능으로 넘어가는 흐름을 보여줍니다. 같은 prompt에서 시간이 60~80% 줄었고, token이 오히려 늘어난 과제에서도 대기 시간은 절반 안팎으로, 잘 나온 과제에서는 절반 이하로 떨어졌습니다. 품질은 최상위 모델에 미치지 못하지만 중간 등급으로서는 충분한 수준입니다.

모델을 바꿀지 결정할 때 확인할 순서를 이렇게 제안합니다. 첫째, 같은 prompt로 실제 소요 시간을 재봅니다. 둘째, 캐시 token까지 포함한 총 token과 작업당 비용을 함께 봅니다. 셋째, 추론 강도를 낮음이나 중간으로 내려도 결과가 유지되는지 확인합니다. 넷째, 최상위 모델은 정말 중요한 작업에만 남겨두고 일상적인 agent 작업은 중간 등급에 맡깁니다. token 숫자만 보면 시간이 얼마나 걸릴지 알 수 없으므로, 대기 시간을 반드시 따로 측정하는 것이 이 순서의 핵심입니다.