Перейти к содержимому
AI / ML~3 мин чтения

Context window

Сколько текста LLM может «помнить» в одном диалоге. У Claude Sonnet 4.6 — 200K токенов (~150 000 слов). У GPT-4 — 128K. Превысил лимит — модель забывает начало.

Развёрнутое объяснение

Context window — максимальное количество токенов, которые LLM может обработать в одном запросе. Туда входит и system prompt, и история диалога, и retrieved chunks, и текущий вопрос, и место под ответ.

Современные размеры: Claude Sonnet 4.6 — 200K (~150K слов), Claude Opus — 1M, GPT-4-Turbo — 128K, GPT-5 — 256K, Gemini 2.5 — 2M.

Большой context window не панацея: чем больше контекста, тем сложнее модели «найти иголку в стоге сена». На практике 100-200K — sweet spot.

Где это в услугах WRAW

  • В RAG-ботах ограничиваем context window до 8-16K (баланс качества и цены)

Частые вопросы

Можно ли «обойти» context window?

Через RAG (искать только релевантные куски), summarization (сжимать историю), prompt caching (кешировать system prompt).

Дороже ли использовать большой context?

Да. Цена линейно зависит от input tokens. 200K input — в 100 раз дороже 2K input.

Связанные термины

Покажем, где Context window даст результат

Опишите задачу своими словами — за 1 рабочий день пришлём понятное предложение с шагами и стоимостью.