Контекстное окно — одна из ключевых характеристик современной языковой модели, определяющая, какой объём информации она способна учитывать одновременно при формировании ответа. По мере развития ИИ контекстные окна увеличиваются от десятков тысяч до миллионов и даже десятков миллионов токенов, что меняет возможности работы с документами, кодовыми базами, корпоративными знаниями и длительными агентными задачами.
В эпоху работы с ИИ понятие контекстного окна стало во главу угла, особенно в Enterprise-проектах, где артефакты для промпта занимают сотни страниц
Что такое контекстное окно
Контекстное окно — это максимальный объём токенов, который модель может учитывать в рамках одного запроса или текущего контекста взаимодействия. В него попадает не только текст последнего сообщения пользователя, но и история диалога, инструкции, документы, результаты работы инструментов, фрагменты кода и другие переданные модели данные.
Суть
Языковая модель не воспринимает текст как человек, который может условно «держать в голове» неограниченное количество информации. Перед обработкой входные данные разбиваются на токены — элементы текста, которыми модель оперирует при построении ответа. Контекстное окно определяет, сколько таких токенов может одновременно участвовать в вычислении.
Контекстное окно — это рабочая память модели в рамках конкретного взаимодействия: чем оно больше, тем больше информации модель потенциально может учитывать одновременно.
При этом большой контекст не означает автоматически более высокое качество ответа. Важны не только количество доступных токенов, но и способность модели находить нужную информацию внутри большого объёма данных, правильно связывать удалённые фрагменты и не терять важные детали.
Принцип работы
Когда пользователь отправляет запрос, система преобразует входные данные в токены. В контекст могут входить текущий запрос, предыдущие сообщения, системные инструкции, содержимое загруженных файлов и результаты вызванных инструментов. В совокупности они формируют последовательность, которую модель обрабатывает для генерации следующего фрагмента ответа.
Размер контекстного окна задаёт верхнюю границу этой последовательности. Причём в зависимости от конкретной модели и API в общий лимит могут входить как входные, так и выходные токены. Например, документация Google прямо определяет context window как совокупный предел входных и выходных токенов.
Поэтому контекстное окно нельзя напрямую сравнивать с объёмом текста в страницах. Один и тот же документ может занимать разное количество токенов в зависимости от языка, структуры, кода, таблиц и способа токенизации. Для Gemini Google указывает ориентир около четырёх символов на токен для английского текста, однако это только приблизительная оценка.
Простыми словами
Контекстное окно можно представить как размер рабочего стола ИИ. Если на столе помещается только несколько документов, модель может одновременно работать с ними. Если рабочий стол значительно больше, на него можно положить целую книгу, техническую документацию, исходный код проекта и дополнительные материалы.
Для пользователя это означает возможность давать модели всё более объёмные исходные данные без необходимости постоянно разбивать их на небольшие фрагменты. Особенно заметно преимущество больших контекстов при анализе больших документов, исследовании кодовых баз, работе с корпоративной документацией и длительных агентных задачах.
Тенденция к увеличению
В последние годы развитие LLM сопровождается быстрым увеличением контекстных окон. Если ранние массовые модели работали с несколькими тысячами токенов, современные системы перешли к сотням тысяч и миллионам. Например, GPT-5.6 имеет контекстное окно около 1,05 млн токенов, Claude 4.6 предлагает контекст до 1 млн токенов, а Qwen3.5-Plus также имеет окно 1 млн токенов.
Отдельный пример — Llama 4 Scout, для которой Meta заявляет контекстное окно в 10 млн токенов. Это показывает, что увеличение контекста стало одним из самостоятельных направлений развития архитектур LLM.
Причина такого роста связана прежде всего с переходом от простого диалога к работе ИИ с большими массивами информации и автономными агентами. Агенту необходимо одновременно учитывать задачу, документацию, историю действий, код, результаты инструментов и промежуточные решения. Чем больше такой контекст, тем меньше информации приходится постоянно извлекать, сжимать или повторно передавать модели.
Размер контекстного окна у разных LLM
Размер контекстного окна сегодня существенно различается между моделями, а у некоторых семейств зависит от конкретной версии и режима доступа. При этом сравнивать только абсолютные значения недостаточно: большое окно должно сочетаться со способностью модели эффективно работать с длинным контекстом.
| Модель | Контекстное окно | Комментарий |
|---|---|---|
| GPT-5.6 Sol | 1,05 млн токенов | Флагманская модель OpenAI; API |
| GPT-5.6 Luna | 1,05 млн токенов | Оптимизирована для массовых и экономичных сценариев |
| GPT-5.6 Terra | 1,05 млн токенов | Баланс производительности и стоимости |
| Claude Opus 4.6 | 1 млн токенов | Long-context режим в beta |
| Claude Sonnet 4.6 | 1 млн токенов | Long-context режим в beta |
| Qwen3.5-Plus | 1 млн токенов | Хостируемая модель Alibaba Cloud Model Studio |
| Gemini 3.5 Flash | 1 млн токенов | До 65 тыс. выходных токенов |
| DeepSeek-V4 Pro | 1 млн токенов | Поддерживает thinking и non-thinking режимы |
| DeepSeek-V4 Flash | 1 млн токенов | Более производительный и экономичный вариант V4 |
| GigaChat 3 Ultra | 128 тыс. токенов | Актуальная модель GigaChat |
| GPT-5-Codex | 400 тыс. токенов | Специализированная модель для агентного программирования |
| codex-mini-latest | 200 тыс. токенов | Модель для Codex CLI |
| Llama 4 Scout | 10 млн токенов | Открытая мультимодальная модель Meta |
| Llama 4 Maverick | 1 млн токенов | Открытая мультимодальная модель Meta |
| Mistral Large 3 | 256 тыс. токенов | Открытая универсальная мультимодальная модель |
Для GPT-5.6 Sol, Terra и Luna OpenAI указывает контекстное окно 1,05 млн токенов и максимальный объём генерируемого ответа 128 тыс. токенов. Claude Opus 4.6 и Sonnet 4.6 имеют контекстное окно 1 млн токенов; Anthropic отмечает поддержку такого размера в beta-режиме.
У Qwen3.5-Plus заявлен контекст в 1 млн токенов, Gemini 3.5 Flash также поддерживает 1 млн токенов входного контекста. DeepSeek-V4 Pro и V4 Flash имеют контекст длиной 1 млн токенов.
Российские модели пока представлены более компактными контекстами: например, для GigaChat 3 Ultra Сбер указывает 128 тыс. токенов. Для сравнения, специализированная модель GPT-5-Codex имеет 400 тыс. токенов, а codex-mini-latest — 200 тыс.
При этом рекордным среди перечисленных решений является Llama 4 Scout с заявленным окном в 10 млн токенов. Meta связывает такой размер с возможностью работать с большими массивами документов, пользовательской историей и крупными кодовыми базами.
Управление контекстом в Enterprise и AI SDLC
В корпоративных проектах объём информации, необходимой для работы ИИ, может быть огромным. В него входят требования к продукту, бизнес-процессы, архитектура, исходный код, документация, данные, результаты тестирования, история изменений, регламенты, политики безопасности и множество других артефактов. При использовании AI SDLC и AI-Disrupt PDLC этот контекст становится одним из ключевых ресурсов, от которого зависит качество работы ИИ-агентов.
В Enterprise-продуктах задача заключается уже не только в том, чтобы дать ИИ больше контекста, а в том, чтобы дать каждому агенту именно тот контекст, который необходим ему для выполнения конкретной задачи.
Большое контекстное окно само по себе не решает эту проблему. Если передать агенту всю доступную информацию, он получит избыточный и неоднородный набор данных. Часть сведений окажется нерелевантной, часть может противоречить друг другу, а критически важные ограничения могут потеряться среди большого объёма информации. Поэтому возникает необходимость в управлении контекстом — определении того, какие сведения, в каком виде, в какой момент и какому агенту должны быть доступны.
Особенно ярко это проявляется в AI SDLC. Например, агент, занимающийся генерацией кода, должен видеть архитектурные решения, технические требования, спецификацию интерфейсов и соответствующий участок кодовой базы. Агент, выполняющий тестирование, нуждается уже в другом наборе данных: требованиях, критериях приёмки, тестовых сценариях и результатах предыдущих проверок. Агент, анализирующий безопасность, должен получить политики безопасности, модель угроз, архитектуру и сведения о разрешённых технологиях.
Таким образом, контекст становится управляемым объектом архитектуры. Можно выделять источники контекста, правила его формирования, уровни доступа, механизмы актуализации, маршрутизацию контекста между агентами и контроль его качества. Такой подход позволяет превратить разрозненные корпоративные знания в структурированный Context Supply Chain, через который нужная информация поступает к нужному участнику AI SDLC.
В AI-Disrupt PDLC эта задача становится ещё шире. На разных этапах жизненного цикла продукта работают разные агенты и принимаются разные решения: от исследования проблемы и формирования намерения до проектирования, разработки, тестирования, эксплуатации и дальнейшего развития продукта. Каждый этап формирует собственный контекст, который частично передаётся дальше, а частично остаётся локальным.
Поэтому в Enterprise появляется фактически новый управленческий слой — Context Management. Его задача состоит не просто в увеличении доступного объёма информации, а в организации жизненного цикла контекста: его формирования, структурирования, хранения, версионирования, предоставления агентам, ограничения доступа, проверки актуальности и удаления устаревших сведений.
Популярные вопросы
Контекстное окно часто воспринимается просто как техническая характеристика модели, однако для практического применения в корпоративных ИТ оно влияет на архитектуру решений, стоимость работы с LLM и возможности построения агентных систем.
Что отличает модель с большим контекстным окном
Главное преимущество заключается в способности модели одновременно учитывать больше исходной информации. Это особенно полезно при анализе длинных документов, нескольких связанных файлов, больших программных проектов, истории переписки и результатов многочисленных действий агента.
Например, модель с окном в миллион токенов потенциально может получить значительно больший объём проектной документации или исходного кода в рамках одного контекста, чем модель с лимитом в 32 или 128 тыс. токенов. Это сокращает необходимость агрессивного суммирования и дробления данных.
Однако большой контекст не является гарантией лучшего ответа. Важны качество извлечения информации, способность модели работать с дальними зависимостями и устойчивость рассуждений на длинных последовательностях. Поэтому при выборе LLM для корпоративного применения необходимо оценивать не только размер окна, но и результаты на реальных сценариях.
Что описывает контекстное окно модели
Контекстное окно описывает максимальный объём токенов, доступный модели для обработки в рамках одного контекста. В зависимости от конкретного API в этот объём могут входить пользовательский запрос, системные инструкции, история диалога, переданные документы, результаты инструментов и генерируемый ответ.
Поэтому показатель «1 млн токенов» не следует понимать как «модель может принять миллион токенов текста и затем дополнительно выдать неограниченный ответ». У конкретной платформы существуют отдельные ограничения на вход, выход и их совокупный объём. Например, у GPT-5.6 максимальный размер ответа составляет 128 тыс. токенов при контекстном окне 1,05 млн.
Ограничение контекстного окна
Если суммарный объём данных превышает доступное окно, модель не может обработать весь массив одновременно в исходном виде. Система должна сократить, суммировать, разделить или выборочно извлечь контекст. В зависимости от реализации API превышение лимита может приводить к ошибке запроса или необходимости изменить состав входных данных.
Именно поэтому даже при наличии миллионного окна сохраняют значение технологии RAG, context engineering, контекстное кэширование и интеллектуальный отбор информации. Большой контекст не отменяет необходимость правильно организовывать данные: иногда лучше передать модели 100 тыс. наиболее релевантных токенов, чем загружать миллион токенов, значительная часть которых не относится к задаче.
Для корпоративных ИИ-систем это особенно важно. Рост контекстного окна расширяет технические возможности LLM, но одновременно увеличивает потенциальные расходы на обработку данных и требования к архитектуре хранения, поиска, передачи и контроля контекста.

