What I Do

토큰과 컨텍스트 윈도우란? AI에 긴 자료를 넣기 전에 알아 둘 기초

15분 읽기

AI 요금표에 나오는 토큰은 무엇이고, 컨텍스트 윈도우는 왜 중요할까요? Anthropic, OpenAI, Google의 공식 문서를 바탕으로 토큰의 뜻, 긴 자료를 넣을 때 달라지는 점, 토큰 단위로 매겨지는 요금 구조를 정리했습니다.

토큰과 컨텍스트 윈도우란? AI에 긴 자료를 넣기 전에 알아 둘 기초

토큰은 AI 모델이 글을 읽고 쓰는 가장 작은 단위이고, 컨텍스트 윈도우는 모델이 한 번에 참고할 수 있는 토큰의 양입니다. 긴 자료를 넣을수록 이 공간을 많이 차지하고, API 요금도 주고받은 토큰 수만큼 매겨지는데요. 이 글에서는 Anthropic, OpenAI, Google의 공식 문서를 바탕으로 토큰과 컨텍스트 윈도우의 뜻, 긴 자료를 넣을 때 달라지는 점, 요금 구조를 정리했습니다.

AI 모델 소개 글을 보다 보면 "100만 토큰 컨텍스트 윈도우"나 "100만 토큰당 몇 달러" 같은 표현이 꼭 나오는데요. 글자 수나 단어 수가 아니라 왜 토큰이라는 단위를 쓰는지, 그 숫자가 실제로 무엇을 뜻하는지 궁금하셨던 적 있으신가요? 저도 업무에 AI를 쓰면서 공부해 보니, 이 두 개념을 알고 나면 긴 보고서를 넣을 때 무엇을 조심해야 하는지, 비용이 어디서 늘어나는지가 훨씬 잘 보였습니다. 이번 글에서는 이 기초 개념을 차근차근 정리해 보겠습니다.

1. 토큰은 무엇일까요?

Anthropic의 용어집은 토큰을 언어 모델이 다루는 가장 작은 단위로 설명하고, 토큰 하나가 단어일 수도, 단어의 일부나 글자 하나일 수도 있다고 적고 있습니다. 우리가 입력한 문장은 모델 안에서 이런 토큰의 나열로 바뀐 뒤에 처리되기 때문에, 모델 입장에서는 글자 수보다 토큰 수가 기준이 되는 것이죠.

공식 문서에 나오는 대략적인 환산 기준은 이렇습니다.

출처대략적인 기준
AnthropicClaude에서 토큰 하나는 영어 약 3.5글자이고, 언어에 따라 달라집니다
GoogleGemini에서 토큰 하나는 약 4글자이고, 100토큰은 영어 단어 60개에서 80개 정도입니다

Gemini 토큰 문서는 짧은 단어는 통째로 토큰 하나가 되기도 하고, 긴 단어는 여러 토큰으로 쪼개진다고 설명하는데요. 눈여겨볼 점은 두 기준 모두 영어 기준이라는 것입니다. 한국어 환산 비율은 제가 찾아본 공식 문서에 따로 나와 있지 않아서, 한국어 자료는 뒤에서 소개할 토큰 계산 기능으로 직접 세어 보시는 게 정확합니다.

같은 글이라도 모델에 따라 토큰 수가 달라질 수 있다는 점도 알아 두시면 좋은데요. Anthropic은 요금 문서에서 Claude Opus 4.7부터 쓰이는 새 토크나이저(글을 토큰으로 쪼개는 방식)가 같은 글을 이전 방식보다 약 30% 더 많은 토큰으로 나눈다고 안내하고 있습니다. 늘어나는 정도는 내용에 따라 다르다고 하니, 모델을 바꾸셨다면 토큰 수를 다시 세어 보시는 게 좋습니다.

2. 컨텍스트 윈도우는 무엇일까요?

Anthropic의 컨텍스트 윈도우 문서는 컨텍스트 윈도우를 모델이 답을 만들 때 참고할 수 있는 모든 텍스트이며, 모델이 만들어 내는 답변까지 포함한다고 설명합니다. 모델이 학습한 방대한 데이터와는 다른 개념이고, 모델의 "작업 기억"에 해당한다고 표현하죠.

책상에 비유하면 이해가 쉬운데요. 모델이 학습한 지식이 도서관 전체라면, 컨텍스트 윈도우는 지금 일하고 있는 책상 위의 공간입니다. 지시문, 첨부한 문서, 지금까지 나눈 대화, 그리고 모델이 새로 쓰는 답변까지 모두 이 책상 위에 올라가야 하고, 책상이 가득 차면 더 올려 둘 수 없게 되는 것이죠.

같은 문서는 컨텍스트 윈도우에 들어가는 것을 이렇게 정리합니다.

  • 시스템 프롬프트: 모델에게 미리 주는 기본 지시
  • 대화 기록: 이전 질문과 답변 전부, 첨부한 문서와 이미지 포함
  • 도구 정의와 결과: 모델이 쓰는 도구의 설명과 실행 결과
  • 새 답변: 이번에 모델이 생성하는 출력

2026년 9월 25일에 확인한 기준으로, Anthropic 문서에는 Claude Opus 5.5와 Sonnet 5 등이 100만 토큰, Claude Sonnet 4.5 등 그 밖의 모델은 20만 토큰으로 나와 있습니다. Gemini 긴 컨텍스트 문서도 많은 Gemini 모델이 100만 토큰 이상의 컨텍스트 윈도우를 갖는다고 소개하고 있습니다.

3. 긴 자료를 넣으면 무엇이 달라질까요?

그렇다면 컨텍스트 윈도우가 크면 자료를 많이 넣을수록 좋은 걸까요? Anthropic 문서는 오히려 맥락이 많다고 자동으로 좋아지는 것은 아니라고 짚는데요. 토큰 수가 늘수록 정확도와 기억해 내는 능력이 떨어지는 현상이 있고, 이를 컨텍스트 로트(context rot)라고 부른다고 설명합니다. 그래서 얼마나 많이 넣을 수 있는지만큼 무엇을 넣을지 고르는 일이 중요하다는 것이죠.

Gemini 문서도 비슷한 한계를 적어 두었습니다. 긴 자료 속에서 정보 하나를 찾는 시험에서는 성능이 높지만, 찾아야 할 정보가 여러 개가 되면 같은 정확도가 나오지 않는다고 하고, 입력이 길수록 첫 응답까지 걸리는 시간도 대체로 길어진다고 안내합니다.

두 회사의 문서가 공통으로 권하는 방법도 있습니다.

  • 긴 자료는 앞에, 질문은 맨 뒤에: Anthropic은 2만 토큰이 넘는 긴 자료를 다룰 때 문서를 프롬프트 위쪽에 두고 질문을 끝에 두면, 여러 문서가 섞인 복잡한 입력에서 특히 답변 품질이 테스트상 최대 30%까지 좋아졌다고 밝히고 있고, Gemini 문서도 긴 맥락에서는 질문을 끝에 두는 편이 대체로 낫다고 설명합니다.
  • 관련 부분을 먼저 인용하게 하기: Anthropic은 긴 문서 작업에서 관련 부분을 먼저 인용하게 한 뒤 작업을 시키면 나머지 내용에 덜 흔들린다고 안내합니다.

참고로 Anthropic 문서에는 claude.ai 같은 채팅 화면이 오래된 내용부터 밀어내는 방식으로 컨텍스트를 관리할 수도 있다는 설명도 있는데요. 대화가 아주 길어졌다면 처음에 준 지시가 그대로 남아 있다고 기대하기보다, 중요한 조건을 다시 적어 주는 편이 안전하다고 생각합니다.

4. 요금은 왜 토큰 단위로 매겨질까요?

Anthropic과 OpenAI의 개발자용 API 가격표는 100만 토큰당 가격으로 표시되어 있고, 모델에 넣는 입력과 모델이 만드는 출력의 가격이 따로 매겨집니다. 예를 들어 2026년 9월 25일에 확인한 Anthropic 요금 문서 기준으로 Claude Sonnet 5는 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러인데요. 출력이 입력보다 비싸게 책정되어 있다는 점은 OpenAI와 Anthropic의 가격표에서 공통으로 볼 수 있습니다.

여기서 놓치기 쉬운 부분이 대화가 쌓이는 구조입니다. Anthropic 문서에 따르면 매 턴의 입력에는 이전 대화 기록 전체와 새 메시지가 함께 들어가는데요. 대화가 길어질수록 매번 보내는 입력 토큰이 늘어나기 때문에, 같은 질문이라도 긴 대화 끝에서 물으면 비용이 더 들 수 있습니다.

긴 컨텍스트의 가격 정책은 회사마다 다릅니다. Anthropic은 Claude 4.6 이후 모델에서 100만 토큰 전체를 표준 가격으로 받는다고 밝히고 있고, OpenAI 가격표는 일부 모델에 짧은 컨텍스트와 긴 컨텍스트 가격을 따로 두고 있습니다. 가격은 자주 바뀌니 실제로 쓰시기 전에 각 회사의 가격 페이지를 다시 확인해 주세요.

비용을 미리 가늠하고 싶다면 토큰 계산 기능을 쓰시면 됩니다. Anthropic, OpenAI, Google 모두 요청을 보내기 전에 입력 토큰 수를 세는 기능을 제공하고 있습니다.

정리

토큰은 AI가 글을 다루는 단위이고, 컨텍스트 윈도우는 한 번에 올려 둘 수 있는 책상의 크기이며, API 요금은 그 위를 오간 토큰 수로 매겨집니다. 책상이 넓어졌다고 모든 자료를 한꺼번에 올리기보다, 필요한 자료를 골라 앞에 두고 질문을 끝에 두는 것이 공식 문서들이 공통으로 권하는 방법이었습니다. 긴 보고서나 데이터를 AI에 맡기실 때 이 기준을 참고해 주세요.

자주 묻는 질문

토큰 하나는 몇 글자인가요?
모델과 언어에 따라 다릅니다. Anthropic은 Claude에서 토큰 하나가 영어 약 3.5글자라고 설명하고, Google은 Gemini에서 약 4글자라고 설명합니다. 한국어 비율은 공식 문서에 따로 나와 있지 않아서, 토큰 계산 기능으로 직접 세어 보는 것이 정확합니다.
컨텍스트 윈도우가 크면 무조건 좋은가요?
더 긴 자료를 한 번에 다룰 수 있다는 장점은 있지만, Anthropic 문서는 토큰이 늘수록 정확도와 기억해 내는 능력이 떨어질 수 있다고 설명합니다. 필요한 자료를 골라 넣는 것이 여전히 중요합니다.
대화가 길어지면 비용이 왜 늘어나나요?
Anthropic 문서에 따르면 API의 기본 동작에서는 매 턴마다 이전 대화 기록 전체가 입력으로 함께 들어가기 때문입니다. 대화가 쌓일수록 한 번에 보내는 입력 토큰이 많아지고, 입력 토큰만큼 요금이 매겨집니다.

관련 글 더 보기