ННейроАссистент

Влезет ли документ в контекстное окно

Укажите объём документа и размер окна модели — калькулятор покажет, поместится ли он целиком, сколько места останется на ответ и на сколько частей придётся разбить.

Что загружаем

В расчёт заложено ~800 токенов на системный промпт и служебную разметку. Оценка приблизительная: точное число зависит от токенизатора модели.

Влезает целиком

Ваш документ — примерно 39 023 токенов. Вместе с ответом и служебными данными нужно 41 823 из 128 000 доступных.

Заполнение окна33%

В это окно целиком поместится документ примерно на 160 страниц А4 при текущей доле русского текста.

Что делать, если не влезает

  1. 1.Убрать лишнее: оглавления, колонтитулы, повторяющиеся шапки, приложения, которые не нужны для ответа. Часто это сразу минус треть объёма.
  2. 2.Разбить на части по смыслу, а не механически: главы, разделы, периоды. Задавать вопрос к каждой части отдельно и сводить ответы.
  3. 3.Сжать в два прохода: сначала попросить конспект каждой части, потом работать с конспектами вместо исходника.
  4. 4.Взять сервис с поиском по документам: он сам найдёт нужные фрагменты и подложит их модели, вместо того чтобы грузить весь файл.
  5. 5.Перейти на модель с бо́льшим окном — но помните, что длинный контекст стоит дороже и качество ответов к концу окна обычно проседает.

Нужна стоимость запроса, а не только объём? Калькулятор токенов и стоимости посчитает цену в долларах и рублях. Что такое контекстное окно — в словаре.

Частые вопросы

+Что такое контекстное окно?

Это максимальный объём текста, который модель удерживает за один раз: ваш запрос, историю диалога, загруженные файлы и собственный ответ. Когда объём превышен, начало разговора выпадает и модель «забывает» его.

+Почему нужен запас на ответ?

Ответ модели расходует то же окно, что и запрос. Если загрузить документ впритык, места на развёрнутый ответ не останется — модель оборвёт его на середине или откажется отвечать.

+Модель с окном в миллион токенов решает проблему?

Не полностью. Длинный контекст стоит дороже, ответы приходят медленнее, а качество работы с фрагментами в середине окна обычно проседает. Часто эффективнее разбить документ по смыслу и работать с частями.

+Почему русский документ занимает больше токенов?

Токенизаторы большинства моделей обучены преимущественно на английских данных, поэтому кириллица дробится примерно вдвое мельче. Один и тот же по смыслу текст на русском съедает заметно больше окна.