token토큰

token은 AI 모델이 텍스트를 나누어 처리하는 단위로, 단어 또는 문자 하나와 반드시 일치하지는 않는다.

기사 62편
최근 언급

token(모델이 처리하는 텍스트 단위)은 AI 모델이 입력과 출력을 다룰 때 사용하는 단위다. 단어 전체일 수도, 단어의 일부나 문장부호일 수도 있어 단어·문자 수와 일대일로 대응하지 않는다.

token 수는 context window(모델이 한 번에 참조할 수 있는 텍스트의 범위), 사용량 기록, API 요금을 나타내는 데 쓰인다. 디자인 분야의 token은 색상·간격 같은 값을 정의하는 변수로, AI 모델의 텍스트 단위와는 다른 뜻이다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

coordinator의 effort를 Low보다 올려도 조율 품질은 크게 나아지지 않고 token 비용만 늘어나는 것으로 보입니다.

100만 token당 가격 Haiku 5.5(10만 token 이하) Haiku 5.5(10만 token 초과) Haiku 4.5 Sonnet 5.5

방식은 token(모델이 글을 나눠 처리하는 단위)의 분포에 통계적인 치우침을 심어 두는 것입니다.

도구 정의에 쓰는 token 약 7만 2,000개(도구 50개 넘게) 처음에 약 500개

가중치 크기는 약 10GB로 줄었고, 256k token 길이의 문서 속에 숨긴 암호를 15번 모두 찾아냈으며, 코딩 문제 100개 가운데 75개를 통과했습니다.

일반 대화형 모델은 답을 token(모델이 글을 처리하는 단위) 하나씩 차례로 생성합니다.

대형 언어 모델은 혼자서는 글을 받아 다음에 올 token(모델이 글을 처리하는 단위)을 예측하는 장치일 뿐입니다.

실행 전 몇 분의 확인으로 서식 오류, 불필요한 절, 잘못된 자료 출처를 걸러 내 시간과 token(AI가 처리하는 글자 단위이자 사용량 기준)을 아낄 수 있습니다.

사용한 context token 약 8만 4,000개 약 12만 9,000개

pretraining(사전 학습)은 앞의 단어들을 보고 다음 token(모델이 글을 처리하는 단위)을 맞히는 학습입니다.

Memories와 Chronicle은 token(AI가 글을 처리하는 단위)을 더 쓰지만, 지난 프로젝트의 세부 사정을 기억하는 동료가 생기는 만큼 그 비용을 치를 만하다는 것이 OpenAI 팀의 판단입니다.

대화의 각 차례, 도구 호출, prompt 내용, 모델의 응답, token 사용량, 지연 시간, 비용이 span(trace를 이루는 작업 단위)으로 쌓입니다.

첫 token(모델이 글을 처리하는 단위)이 나오기까지 0.25초

핵심 강점에 맞으면 직접 만들고, 여러 모델로 요청을 나눠 보내는 token 라우팅처럼 새 역량이 필요한 분야는 인수를 택합니다.

모델 하나가 내는 속도는 초당 50~60 token 정도라, 여러 단계를 거치는 코드 작업이라면 agent 여러 개를 동시에 돌려야 합니다.

가족이 운영하는 곳입니다' 같은 매장 소개 문구는 검색과 관계없는 token(모델이 글을 처리하는 단위)을 더해 agent의 검색을 헷갈리게 합니다.

처음에는 많은 token(AI가 처리하는 글자 단위) 사용량을 무료로 제공해 이용자 규모를 키우고, 이후 Muse를 통해 이뤄지는 거래에서 작은 수수료를 받겠다는 계획입니다.

Gemini Robotics ER 2의 context window(모델이 한 번에 참고할 수 있는 정보량)는 128,000 token인데, 영상 입력으로 바꾸면 약 3분 분량입니다.

직접 만든 프로그래밍 언어와 강화학습 루프를 담은 해커톤 제출작을 여러 차례에 걸쳐 평가할 때는 200만 token(모델이 처리하는 글의 단위) 넘게 쓰면서도 sandbox 상태를 잃지 않았습니다.

한 AI 게이트웨이(여러 모델로 요청을 나눠 보내는 서비스)의 2024년 7월부터 2025년 10월까지 집계에서는 내려받아 쓸 수 있는 공개 가중치(open-weights) 모델이 token(모델이 처리하는 글의 단위) 사용량의 55.8%를 차지해 비공개 모델의 44.2%를 앞섰습니다.

일반 사용은 무료로 주당 1억 token(AI가 글을 처리하는 단위)까지 쓸 수 있고, 더 많이 쓰는 사용자를 위해 월 $20(5억 token)와 월 $100(30억 token) 요금제가 있습니다.

Argon의 도입 가격은 입력 100만 token(모델이 글을 처리하는 단위)당 $2, 출력 100만 token당 $10로, Claude Sonnet 5.5와 같습니다.

출력 100만 token과 도입 가격

능력이 설계가 아니라 대규모 사전 학습에서 예측하기 어렵게 나타나고, 모델은 기본적으로 다음 token(모델이 처리하는 글의 단위)을 예측하는 통계 기계라서 추론 과정을 사실과 맞대어 검증하기 어렵다는 것입니다.

7월 10일, 한 agent가 공개 인터넷에 노출된 Hugging Face 쓰기 권한 token을 찾아냈다고 알렸습니다.

크레딧 방식을 거쳐 지금은 token, 컴퓨팅, 외부 API 비용을 원가 그대로 청구하고 여러 모델과 도구를 엮어 실행해 주는 orchestration 수수료를 따로 받습니다.

prompt caching(앞서 보낸 내용을 저장해 두고 다시 쓰는 기능)이 살아 있으면 입력 token 비용을 약 95% 덜 내지만, 활동 없이 1시간이 지나면 cache가 만료되어 수천 token이 넘는 맥락을 정가로 다시 읽게 됩니다.

개발자 각자가 좋아하는 회사와 모델로 수백만 token(AI가 글을 처리하는 단위)을 쓰고, 나중에 청구서를 받은 경영진이 그 비용으로 어떤 사업 가치를 얻었는지 묻는 상황입니다.

…량 화면을 확인하지 않은 채 추가 크레딧을 사거나, agent(사람 대신 여러 단계의 작업을 스스로 처리하는 AI)가 웹 화면을 일일이 클릭하게 두거나, 큰 파일을 채팅창에 그대로 올리는 습관이 token(AI가 글을 처리하는 단위이자 사용량을 세는 기준)을 빠르게 소모하기 때문입니다.

개발자 컴퓨터에는 잠금이 풀린 SSH 키, 클라우드 자격 증명, 개인 token(서비스 접근 권한을 증명하는 문자열)이 그대로 놓여 있고 인터넷도 제한 없이 열려 있습니다.

접근성 트리는 원래 화면 낭독기를 위해 만든 기술인데, 이 덕분에 언어 모델이 버튼, 라벨, 입력 칸을 token(모델이 처리하는 글 조각 단위)을 아끼는 형태로 읽을 수 있습니다.

출력 생성 속도 초당 51 token 초당 184 token

초대 코드가 한 번 적용될 때마다 기존 사용자와 초대받은 사용자에게 각각 10억 token(모델 사용량을 나타내는 단위)이 추가됩니다.

API 가격 입력 100만 token당 $2, 출력 100만 token당 $10

다만 Space는 기존 업무 도구를 대체할 만큼 기능이 갖춰졌는지, Astra Ultrafast는 빠른 출력에 따른 token(모델이 텍스트를 처리하는 단위) 사용량을 감당할 만한지 따져 봐야 합니다.

OpenAI는 ChatGPT Pro 신규 가입을 재개하면서 이용량 산정 방식과 token(모델이 글을 처리할 때 세는 기본 단위) 소모 기준을 바꿨습니다.

공개된 캐시 입력 가격은 100만 token당 $0.10입니다.

agent를 여러 개 두고 작업을 나누면 작업에 쓰는 token(모델이 처리하는 텍스트 단위)과 지연 시간이 늘 수 있다는 점도 함께 고려해야 합니다.

API 요금은 100만 token(모델이 처리하는 텍스트 단위)당 다음과 같습니다.

OpenAI가 제시한 GPT-6 Luna의 API 가격은 입력 token(모델이 정보를 처리할 때 사용하는 단위) 100만 개당 $0.10, 출력 100만 개당 $0.50입니다.

활용이 지나치게 적다고 본 연간 token 비용 $5천

Webcmd 저장소는 반복 실행에서 token(모델이 텍스트를 처리하는 단위) 사용량을 최대 10분의 1로 줄인다고 소개하지만, 이는 위 표의 완료 정확도나 비용과는 별개의 수치입니다.

OpenRouter에 표시된 Jev 입력 가격은 token(모델이 처리하는 텍스트 단위) 100만 개당 약 $0.042이며 출력 가격은 $0입니다.

작업에는 12시간이 걸렸고 26억 token이 처리됐으며, API 크레딧 지출은 $1,000 미만이었습니다.

이는 token(모델이 처리하는 텍스트 단위) 사용량을 늘려 비용을 키우면서도 답의 신뢰성을 보장하지 못하는 방식입니다.

두 버전의 High를 같은 설정으로 간주해 이전 값을 그대로 옮기면 응답이 길어지고 출력 token(모델이 처리하거나 생성하는 텍스트 단위) 비용이 불필요하게 늘 수 있습니다.

실험 전체에서 두 agent가 쓴 token(모델이 처리하는 텍스트 단위)의 양도 크게 달랐습니다.

이 과정에서 모델은 연구자의 인증 token(접근 권한을 증명하는 문자열)을 이용했습니다.

2주 동안 약 $3,000어치 token(모델이 처리하는 텍스트 단위)을 사용한 작업 경험에서는 Claude Opus 5.5의 글쓰기, 애니메이션 제작, 웹 디자인이 특히 돋보였습니다.

설정의 화면 꾸미기 항목에는 Codex 데스크톱 앱과 맞닿은 테마 선택지가 있고, 사용자 프로필에는 token(모델이 처리하는 텍스트 단위) 사용 기록과 작업 시간 등의 통계가 표시됩니다.

처음부터 전체 대화를 요약하기보다 오류 유형과 빈도, token(모델이 처리하는 텍스트 단위) 사용량이 큰 세션 등 점검 대상을 좁혀 상위 개선점만 요청하는 편이 유용합니다.

Deel UI Playground는 엔지니어링 팀이 만든 내부 GitHub 저장소로, Deel UI 디자인 시스템 token(색상·간격 같은 디자인 값을 정의한 변수)과 의존성, 로컬 서버 명령이 미리 설정돼 있습니다.

API 가격은 입력 token(모델이 텍스트를 처리하는 단위) 100만 개당 $0.50, 캐시된 입력 token 100만 개당 $0.05, 출력 token 100만 개당 $4.00입니다.

2026년 9월 기준 Jev의 가격은 입력 100만 token(모델이 텍스트를 처리하는 단위)당 $0.042이고, 출력 token에는 비용이 붙지 않습니다.

소비 token과 스토리지 등 자원 소비량

반대로 변수 이름 같은 저수준 구현 세부까지 명세에 적는 것은 token을 낭비하고 agent의 문제 해결 능력을 묶습니다.

token을 오히려 더 쓴 과제에서도 대기 시간은 절반 안팎으로 줄었고, 절반 이하로 떨어진 과제도 여럿 있었습니다.

1,300억 token과 $1,000만에서 $4,000만

메모리 용량은 어떤 크기의 모델을 올릴 수 있는지를 정하고, 메모리 대역폭은 그 모델이 초당 몇 개의 token(AI가 글을 만들어 내는 최소 단위)을 생성하는지를 정합니다.

반면 답변을 한 글자씩 써 내려가는 token 생성 속도는 1.5~1.7배 빨라지는 데 그쳤습니다.

평가용 보조 스크립트는 응답에서 token 패턴과 외부 전송 표현을 찾아 위험 행동 문자열을 만들고, 채점기는 비밀 공유가 나오면 오답, 안전하면 정답으로 표시합니다.

…무형 지식 업무 benchmark(모델 성능을 비교하는 표준 시험)에서 같은 회사의 Claude Fable 5.1과 경쟁사 모델을 대부분 앞섰고, token 가격은 Opus 5보다 20% 내렸으며, token을 덜 쓰고 더 빨리 끝내는 덕분에 같은 작업의 총비용은 약 40% 줄었습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.