Блог · Редакция FatherGPT · 8 мин · обновлено 9 августа 2026

Нейросеть для документов: PDF, таблицы, договоры

Договор на 40 страниц, годовой отчёт, выгрузка из 1С. Разбираем, как формулировать вопросы к документу, где нейросеть даёт настоящую экономию времени и в каком месте ей нельзя верить ни при каких условиях.

Что вообще спрашивать у длинного документа

Первое, что делает человек с загруженным PDF, — пишет «перескажи». И получает ровно то, что просил: пересказ. Пять абзацев, повторяющих оглавление своими словами, из которых нельзя принять ни одного решения. Формально ответ верный, практически бесполезный.

Причина в постановке. «Перескажи» не содержит критерия важности, поэтому модель берёт равномерную выборку по всему тексту — по абзацу на раздел. А вам нужна не равномерность, а то, что влияет на ваше решение. Значит, критерий надо дать явно.

Вопросы, которые работают на любом типе документа:

  • «Какие обязательства ложатся на меня и в какие сроки? Оформи таблицей: обязательство, срок, пункт документа».
  • «Что здесь может обернуться для меня деньгами: штрафы, пени, удержания, доплаты? Перечисли с суммами».
  • «Найди места, сформулированные расплывчато, — где условие можно трактовать двумя способами».
  • «Чего в документе нет из того, что обычно бывает в договорах такого типа?» — вопрос на пропущенное работает неожиданно хорошо.
  • «Что изменилось по сравнению с этой версией?» — со вставкой второго текста.
  • «Дай 5 вопросов, которые я должен задать второй стороне до подписания».

Общий принцип: спрашивайте не «о чём документ», а «что мне с ним делать». Первое модель знает хуже вас, второе — её сильная сторона.

Как получить выжимку, а не пересказ

Выжимка отличается от пересказа тем, что в ней есть отбор. Отбор задаётся тремя вещами: ролью, критерием и жёстким форматом. Уберите любую — получите пересказ обратно.

  1. Роль. «Ты юрист на стороне заказчика» или «ты финансовый директор, читающий отчёт подрядчика». Роль задаёт, что считать существенным.
  2. Критерий отбора. «Выбери только то, что влияет на сумму и сроки». Или: «только то, что создаёт для меня риск».
  3. Жёсткий формат с ограничением. «Ровно 7 пунктов, каждый до 20 слов, в конце каждого — номер страницы». Ограничение заставляет модель отбирать, а не перечислять.
  4. Запрет на воду. «Не пиши вводных фраз, не пересказывай структуру документа, не пиши выводов».
  5. Требование к незнанию. «Если ответа в документе нет, напиши «в документе не указано» — не додумывай».

Последний пункт стоит вписывать в каждый запрос к документу. Без него модель заполняет пробелы правдоподобным содержимым, потому что правдоподобный текст — это ровно то, что она умеет генерировать. С явным разрешением сказать «не указано» она пользуется им заметно чаще.

Ещё один приём против пересказа — попросить сначала оглавление найденного, а потом развернуть нужное. «Перечисли одной строкой все темы, по которым в документе есть конкретные обязательства» → вы видите 12 строк → «разверни пункты 3, 7 и 9». Это и точнее, и дешевле, чем один огромный ответ.

Почему узкие вопросы по частям дают лучший результат

Контринтуитивная вещь: чем длиннее документ, тем хуже работает вопрос «обо всём» и тем лучше — вопрос про конкретное. Причина в том, как модель распределяет внимание внутри контекста.

Весь документ попадает в контекстное окно целиком, но при запросе «перескажи всё» модели приходится удерживать в фокусе одновременно каждую его часть. Внимание размазывается, детали середины проседают сильнее всего — начало и конец документа модели обычно помнят лучше, чем середину. При узком вопросе «что сказано про порядок приёмки работ» она работает с релевантным фрагментом, а остальное остаётся фоном. Ответ выходит точнее и подробнее. Механику окна разбирает справка про контекстное окно.

Отсюда рабочая схема на большой документ:

  1. Первый вопрос — карта: «перечисли разделы и что в каждом регулируется, одной строкой на раздел».
  2. Дальше по одному вопросу на каждый значимый раздел. Не «расскажи про раздел 4», а «какие в разделе 4 сроки и что будет при их нарушении».
  3. Ответы копируйте в отдельный файл — это и есть ваша выжимка, собранная из точных фрагментов.
  4. Финальный вопрос — на связки: «есть ли между разделами 4 и 9 противоречия по срокам».

Про цену. Каждый вопрос по документу отправляет модели документ заново — целиком, вместе с историей переписки. Поэтому десять узких вопросов по 40-страничному PDF стоят заметно дороже одного, и это тот случай, когда стоит осознанно платить. На Gemini 3.1 Pro это 30 токенов за ответ: разбор договора из десяти вопросов — 300 токенов, примерно пятнадцатая часть недельного пакета в 4 500. Как считается списание — в справке про токены.

Таблицы и отчёты: где модель считает, а где врёт

С таблицами есть чёткая граница. Модель хорошо описывает, что в таблице происходит, и плохо считает по ней арифметику. Она не выполняет вычисление, а предсказывает правдоподобный результат вычисления — а правдоподобное число и верное число совпадают не всегда.

Что отдавать смело

  • Объяснить, что означает колонка и как связаны показатели.
  • Найти выбросы: «в каких строках значение резко отличается от соседних».
  • Сформулировать выводы по уже посчитанным итогам: анализ отчёта.
  • Привести разнородные данные к одному формату, разложить свалку в колонки: работа с таблицами.
  • Написать формулу или SQL, которые посчитают за вас: SQL на DeepSeek V4 Flash — 2 токена за ответ.
  • Собрать конспект по многостраничному отчёту.

Что перепроверять всегда

  • Любые суммы, средние, проценты и отклонения, посчитанные самой моделью в ответе.
  • Сортировки и «топ-5»: порядок может оказаться приблизительным.
  • Число строк, попавших под условие. «Таких записей 47» — проверяется фильтром за пять секунд.

Практичнее всего просить не результат, а способ: «напиши формулу Excel, которая посчитает долю просроченных заказов по месяцам». Формулу вы вставите сами, посчитает её Excel, и арифметика будет верной по определению. Модель здесь берёт на себя ту часть, в которой сильна, — перевод задачи с человеческого языка на язык инструмента.

Договоры: главный риск и как его закрыть

Разбор договора — одна из самых полезных задач для нейросети и одновременно самая опасная. Полезная, потому что за минуту вы получаете список того, на что стоит посмотреть внимательно, вместо часа чтения. Опасная — из-за одного конкретного свойства.

Модель может уверенно сослаться на пункт, которого в договоре нет. Не «ошибиться в трактовке», а назвать номер и процитировать содержание несуществующего пункта — ровным тоном, без единого признака сомнения. Всё, что имеет юридические последствия, проверяется открытием документа и чтением глазами по указанному номеру. Ответ нейросети — это карта, где искать, а не доказательство того, что там написано.

Проверка занимает меньше времени, чем кажется, если сразу требовать привязку. Впишите в запрос: «после каждого утверждения ставь номер пункта и дословную цитату в кавычках». Дальше вы ищете цитату по документу поиском. Совпало — верно. Не нашлось — утверждение отбрасывается целиком, вместе с выводом, который на нём построен. Такая проверка десяти пунктов занимает пару минут.

Что реально стоит спрашивать у договора:

  • Асимметрию: «какие права есть у второй стороны и нет у меня, и наоборот».
  • Условия расторжения и что происходит с уже уплаченным.
  • Все сроки в одной таблице с указанием, чей это срок.
  • Ответственность: размеры штрафов, потолки, за что именно.
  • Автопродление, изменение цены в одностороннем порядке, подсудность.

Под такой разбор берут сильные модели: Claude Opus 5 за 65 токенов — профильно по договорам, Gemini 3.1 Pro за 30 — когда документ очень длинный. Сравнение моделей на документах собрано отдельно: лучшая нейросеть для документов, а по общему характеру моделей — Claude против Gemini. И, разумеется, разбор нейросетью не заменяет юриста там, где цена ошибки измеряется деньгами: он экономит юристу время, сокращая список вопросов.

Длинный контекст: сколько документа влезает за раз

Объём, который модель видит одновременно, — контекстное окно. Оно конечное, и от него напрямую зависит, можно ли задать вопрос по всему документу сразу или придётся резать. Среди доступных моделей самое просторное окно у Gemini 3.1 Pro — поэтому под многостраничные PDF, годовые отчёты и объёмные выгрузки берут именно её: анализ документов, перевод документов.

Длинное окно снимает проблему «не влезло», но не снимает проблему внимания. Документ, занимающий окно целиком, обрабатывается хуже, чем тот же документ в виде трёх отдельных вопросов по разделам. Технически модель видит всё; практически детали середины проседают. Поэтому «влезает целиком» и «отвечает одинаково точно по любой части» — разные вещи.

Ещё одна ловушка длинной работы с документом: переписка растёт, и вместе с текстом документа модели каждый раз едет вся история. К двадцатому вопросу начало диалога может вытесняться. Признак — модель начинает отвечать так, будто забыла ваши изначальные условия. Лечение простое: попросить итог, открыть новый чат, загрузить документ заново и продолжить с итогом на руках.

Порядок работы: чек-лист

  1. Определите, что вы хотите решить после чтения. Не «изучить документ», а «понять, подписывать или нет», «найти, откуда взялась цифра в отчёте».
  2. Загрузите документ и первым вопросом попросите карту разделов одной строкой на раздел.
  3. Задайте 5–10 узких вопросов по разделам, которые относятся к вашему решению. Требуйте номер пункта и цитату.
  4. Проверьте цитаты поиском по документу. Всё, что не нашлось, — вычеркните.
  5. Числа, суммы и проценты пересчитайте сами или попросите формулу вместо результата.
  6. Соберите выжимку из проверенных ответов и сформулируйте вопросы второй стороне.
  7. Если переписка разрослась — попросите итог, начните новый чат с этим итогом.

Модели доступны и в веб-кабинете, и в Telegram-боте с общим балансом токенов — что удобнее под документы, разобрано в справке Telegram или веб. Какую модель брать под конкретный тип разговора, считали отдельно: выбор модели для чата. А если чат с нейросетью для вас в новинку — начните с базовой статьи, там про формулировки и проверку фактов с нуля.

Частые вопросы

В такой просьбе нет критерия важности, поэтому модель берёт равномерную выборку по всему тексту — по абзацу на раздел. Выжимка получается, когда заданы роль, критерий отбора и жёсткий формат с ограничением по объёму.

Нет. Она может назвать номер и процитировать содержание несуществующего пункта ровным тоном, без признаков сомнения. Требуйте после каждого утверждения дословную цитату и ищите её поиском по документу; не нашлось — вычёркивайте вместе с выводом.

Плохо: она не выполняет вычисление, а предсказывает правдоподобный результат. Просите не число, а способ — формулу или SQL-запрос: посчитает уже ваш редактор, и арифметика будет верной по определению.

Несколько узких. При запросе «обо всём» внимание размазывается по документу, и детали середины проседают сильнее всего, а на конкретном вопросе модель работает с релевантным фрагментом.

Попробуйте сами

Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.