Что вообще спрашивать у длинного документа
Первое, что делает человек с загруженным PDF, — пишет «перескажи». И получает ровно то, что просил: пересказ. Пять абзацев, повторяющих оглавление своими словами, из которых нельзя принять ни одного решения. Формально ответ верный, практически бесполезный.
Причина в постановке. «Перескажи» не содержит критерия важности, поэтому модель берёт равномерную выборку по всему тексту — по абзацу на раздел. А вам нужна не равномерность, а то, что влияет на ваше решение. Значит, критерий надо дать явно.
Вопросы, которые работают на любом типе документа:
- «Какие обязательства ложатся на меня и в какие сроки? Оформи таблицей: обязательство, срок, пункт документа».
- «Что здесь может обернуться для меня деньгами: штрафы, пени, удержания, доплаты? Перечисли с суммами».
- «Найди места, сформулированные расплывчато, — где условие можно трактовать двумя способами».
- «Чего в документе нет из того, что обычно бывает в договорах такого типа?» — вопрос на пропущенное работает неожиданно хорошо.
- «Что изменилось по сравнению с этой версией?» — со вставкой второго текста.
- «Дай 5 вопросов, которые я должен задать второй стороне до подписания».
Общий принцип: спрашивайте не «о чём документ», а «что мне с ним делать». Первое модель знает хуже вас, второе — её сильная сторона.
Как получить выжимку, а не пересказ
Выжимка отличается от пересказа тем, что в ней есть отбор. Отбор задаётся тремя вещами: ролью, критерием и жёстким форматом. Уберите любую — получите пересказ обратно.
- Роль. «Ты юрист на стороне заказчика» или «ты финансовый директор, читающий отчёт подрядчика». Роль задаёт, что считать существенным.
- Критерий отбора. «Выбери только то, что влияет на сумму и сроки». Или: «только то, что создаёт для меня риск».
- Жёсткий формат с ограничением. «Ровно 7 пунктов, каждый до 20 слов, в конце каждого — номер страницы». Ограничение заставляет модель отбирать, а не перечислять.
- Запрет на воду. «Не пиши вводных фраз, не пересказывай структуру документа, не пиши выводов».
- Требование к незнанию. «Если ответа в документе нет, напиши «в документе не указано» — не додумывай».
Последний пункт стоит вписывать в каждый запрос к документу. Без него модель заполняет пробелы правдоподобным содержимым, потому что правдоподобный текст — это ровно то, что она умеет генерировать. С явным разрешением сказать «не указано» она пользуется им заметно чаще.
Ещё один приём против пересказа — попросить сначала оглавление найденного, а потом развернуть нужное. «Перечисли одной строкой все темы, по которым в документе есть конкретные обязательства» → вы видите 12 строк → «разверни пункты 3, 7 и 9». Это и точнее, и дешевле, чем один огромный ответ.
Почему узкие вопросы по частям дают лучший результат
Контринтуитивная вещь: чем длиннее документ, тем хуже работает вопрос «обо всём» и тем лучше — вопрос про конкретное. Причина в том, как модель распределяет внимание внутри контекста.
Весь документ попадает в контекстное окно целиком, но при запросе «перескажи всё» модели приходится удерживать в фокусе одновременно каждую его часть. Внимание размазывается, детали середины проседают сильнее всего — начало и конец документа модели обычно помнят лучше, чем середину. При узком вопросе «что сказано про порядок приёмки работ» она работает с релевантным фрагментом, а остальное остаётся фоном. Ответ выходит точнее и подробнее. Механику окна разбирает справка про контекстное окно.
Отсюда рабочая схема на большой документ:
- Первый вопрос — карта: «перечисли разделы и что в каждом регулируется, одной строкой на раздел».
- Дальше по одному вопросу на каждый значимый раздел. Не «расскажи про раздел 4», а «какие в разделе 4 сроки и что будет при их нарушении».
- Ответы копируйте в отдельный файл — это и есть ваша выжимка, собранная из точных фрагментов.
- Финальный вопрос — на связки: «есть ли между разделами 4 и 9 противоречия по срокам».
Про цену. Каждый вопрос по документу отправляет модели документ заново — целиком, вместе с историей переписки. Поэтому десять узких вопросов по 40-страничному PDF стоят заметно дороже одного, и это тот случай, когда стоит осознанно платить. На Gemini 3.1 Pro это 30 токенов за ответ: разбор договора из десяти вопросов — 300 токенов, примерно пятнадцатая часть недельного пакета в 4 500. Как считается списание — в справке про токены.
Таблицы и отчёты: где модель считает, а где врёт
С таблицами есть чёткая граница. Модель хорошо описывает, что в таблице происходит, и плохо считает по ней арифметику. Она не выполняет вычисление, а предсказывает правдоподобный результат вычисления — а правдоподобное число и верное число совпадают не всегда.
Что отдавать смело
- Объяснить, что означает колонка и как связаны показатели.
- Найти выбросы: «в каких строках значение резко отличается от соседних».
- Сформулировать выводы по уже посчитанным итогам: анализ отчёта.
- Привести разнородные данные к одному формату, разложить свалку в колонки: работа с таблицами.
- Написать формулу или SQL, которые посчитают за вас: SQL на DeepSeek V4 Flash — 2 токена за ответ.
- Собрать конспект по многостраничному отчёту.
Что перепроверять всегда
- Любые суммы, средние, проценты и отклонения, посчитанные самой моделью в ответе.
- Сортировки и «топ-5»: порядок может оказаться приблизительным.
- Число строк, попавших под условие. «Таких записей 47» — проверяется фильтром за пять секунд.
Практичнее всего просить не результат, а способ: «напиши формулу Excel, которая посчитает долю просроченных заказов по месяцам». Формулу вы вставите сами, посчитает её Excel, и арифметика будет верной по определению. Модель здесь берёт на себя ту часть, в которой сильна, — перевод задачи с человеческого языка на язык инструмента.
Договоры: главный риск и как его закрыть
Разбор договора — одна из самых полезных задач для нейросети и одновременно самая опасная. Полезная, потому что за минуту вы получаете список того, на что стоит посмотреть внимательно, вместо часа чтения. Опасная — из-за одного конкретного свойства.
Модель может уверенно сослаться на пункт, которого в договоре нет. Не «ошибиться в трактовке», а назвать номер и процитировать содержание несуществующего пункта — ровным тоном, без единого признака сомнения. Всё, что имеет юридические последствия, проверяется открытием документа и чтением глазами по указанному номеру. Ответ нейросети — это карта, где искать, а не доказательство того, что там написано.
Проверка занимает меньше времени, чем кажется, если сразу требовать привязку. Впишите в запрос: «после каждого утверждения ставь номер пункта и дословную цитату в кавычках». Дальше вы ищете цитату по документу поиском. Совпало — верно. Не нашлось — утверждение отбрасывается целиком, вместе с выводом, который на нём построен. Такая проверка десяти пунктов занимает пару минут.
Что реально стоит спрашивать у договора:
- Асимметрию: «какие права есть у второй стороны и нет у меня, и наоборот».
- Условия расторжения и что происходит с уже уплаченным.
- Все сроки в одной таблице с указанием, чей это срок.
- Ответственность: размеры штрафов, потолки, за что именно.
- Автопродление, изменение цены в одностороннем порядке, подсудность.
Под такой разбор берут сильные модели: Claude Opus 5 за 65 токенов — профильно по договорам, Gemini 3.1 Pro за 30 — когда документ очень длинный. Сравнение моделей на документах собрано отдельно: лучшая нейросеть для документов, а по общему характеру моделей — Claude против Gemini. И, разумеется, разбор нейросетью не заменяет юриста там, где цена ошибки измеряется деньгами: он экономит юристу время, сокращая список вопросов.
Длинный контекст: сколько документа влезает за раз
Объём, который модель видит одновременно, — контекстное окно. Оно конечное, и от него напрямую зависит, можно ли задать вопрос по всему документу сразу или придётся резать. Среди доступных моделей самое просторное окно у Gemini 3.1 Pro — поэтому под многостраничные PDF, годовые отчёты и объёмные выгрузки берут именно её: анализ документов, перевод документов.
Длинное окно снимает проблему «не влезло», но не снимает проблему внимания. Документ, занимающий окно целиком, обрабатывается хуже, чем тот же документ в виде трёх отдельных вопросов по разделам. Технически модель видит всё; практически детали середины проседают. Поэтому «влезает целиком» и «отвечает одинаково точно по любой части» — разные вещи.
Ещё одна ловушка длинной работы с документом: переписка растёт, и вместе с текстом документа модели каждый раз едет вся история. К двадцатому вопросу начало диалога может вытесняться. Признак — модель начинает отвечать так, будто забыла ваши изначальные условия. Лечение простое: попросить итог, открыть новый чат, загрузить документ заново и продолжить с итогом на руках.
Порядок работы: чек-лист
- Определите, что вы хотите решить после чтения. Не «изучить документ», а «понять, подписывать или нет», «найти, откуда взялась цифра в отчёте».
- Загрузите документ и первым вопросом попросите карту разделов одной строкой на раздел.
- Задайте 5–10 узких вопросов по разделам, которые относятся к вашему решению. Требуйте номер пункта и цитату.
- Проверьте цитаты поиском по документу. Всё, что не нашлось, — вычеркните.
- Числа, суммы и проценты пересчитайте сами или попросите формулу вместо результата.
- Соберите выжимку из проверенных ответов и сформулируйте вопросы второй стороне.
- Если переписка разрослась — попросите итог, начните новый чат с этим итогом.
Модели доступны и в веб-кабинете, и в Telegram-боте с общим балансом токенов — что удобнее под документы, разобрано в справке Telegram или веб. Какую модель брать под конкретный тип разговора, считали отдельно: выбор модели для чата. А если чат с нейросетью для вас в новинку — начните с базовой статьи, там про формулировки и проверку фактов с нуля.
Частые вопросы
В такой просьбе нет критерия важности, поэтому модель берёт равномерную выборку по всему тексту — по абзацу на раздел. Выжимка получается, когда заданы роль, критерий отбора и жёсткий формат с ограничением по объёму.
Нет. Она может назвать номер и процитировать содержание несуществующего пункта ровным тоном, без признаков сомнения. Требуйте после каждого утверждения дословную цитату и ищите её поиском по документу; не нашлось — вычёркивайте вместе с выводом.
Плохо: она не выполняет вычисление, а предсказывает правдоподобный результат. Просите не число, а способ — формулу или SQL-запрос: посчитает уже ваш редактор, и арифметика будет верной по определению.
Несколько узких. При запросе «обо всём» внимание размазывается по документу, и детали середины проседают сильнее всего, а на конкретном вопросе модель работает с релевантным фрагментом.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.