Урок 7. Работа с документами и своими данными
Как задавать вопросы своим файлам, почему это надёжнее вопросов по памяти и что категорически нельзя загружать в облачные сервисы.
Цель урока
Научиться работать с собственными документами и понимать границу, за которую данные выносить нельзя.
Почему работа с файлом надёжнее вопроса по памяти
Когда вы спрашиваете модель о чём-то, она отвечает по обучающим данным — и может ошибиться. Когда вы загружаете документ, она работает с текстом, который лежит перед ней. Количество искажений падает в разы.
Это главный практический вывод урока: если у вас есть источник — давайте его, а не спрашивайте по памяти.
Что реально работает
| Задача | Как формулировать |
|---|---|
| Быстро понять суть | «Перескажи в 10 тезисах с указанием разделов» |
| Найти нужное | «В каком разделе говорится о сроках? Процитируй» |
| Сравнить версии | «Что изменилось между этими двумя редакциями?» |
| Извлечь данные | «Собери все суммы и даты в таблицу со ссылкой на страницу» |
| Проверить логику | «Где автор делает вывод, не следующий из приведённых данных?» |
Обратите внимание: почти во всех формулировках есть требование указать место в документе. Это не педантизм — именно ссылка на страницу превращает ответ в проверяемый.
Ограничения, о которых стоит знать заранее
Объём. У каждой модели есть предел текста, который она удерживает за раз, — контекстное окно. Если документ не помещается, модель либо откажется, либо прочитает часть и не скажет об этом. Посчитать заранее можно калькулятором контекста.
Сканы. Документ без текстового слоя — это картинка. Часть сервисов их не видит вовсе, часть распознаёт с ошибками. Проверяйте, что модель действительно прочитала текст: попросите процитировать первый абзац.
Таблицы и формулы. Сложную вёрстку модели искажают. Для документов с расчётами всегда сверяйте ключевые числа с оригиналом.
Когда документов много
Если источников не один, а десятки — база регламентов, архив переписки, библиотека статей, — работает другой подход: система сначала находит подходящие фрагменты и подкладывает их модели. Это называется RAG, и на нём построены сервисы вопросов к базе знаний.
Практическая разница: при загрузке одного файла модель видит его целиком, при работе с базой — только найденные куски. Поэтому качество ответа зависит от качества поиска, и если ответ странный, первым делом стоит проверить, те ли фрагменты нашлись.
Сервисы такого типа собраны в категории баз знаний.
Что нельзя загружать в облачные сервисы
Самая дорогая ошибка в этой теме, и она почти всегда совершается по невнимательности, а не по злому умыслу.
Не отправляйте в зарубежные облачные сервисы:
- Паспортные данные, договоры с фамилиями, базы контактов
- Медицинские документы
- Материалы под соглашением о конфиденциальности
- Внутренние регламенты и коммерческую тайну
- Рабочий код, если это запрещено политикой компании
Проблема не только в том, что данные могут использоваться для обучения — это часто отключается в настройках. Проблема в самом факте передачи персональных данных третьему лицу за рубеж.
Что делать вместо этого
Обезличить. Заменить реальные имена, суммы и реквизиты на условные, обработать, подставить обратно. Работает для большинства задач и занимает пару минут.
Взять российский сервис с хранением данных в РФ — для документов с персональными данными.
Запустить модель локально — для всего, что не должно покидать компьютер вообще. Как это сделать, разбирается в отдельном гайде, а подобрать модель под своё железо можно здесь.
Практическое задание
Возьмите любой свой документ на 10–20 страниц. Загрузите его и задайте три вопроса: один на пересказ, один на поиск конкретного факта с цитатой, один на проверку логики. Проверьте цитату по оригиналу — совпадает ли она дословно.
Главное из урока
- Если есть источник — давайте его, а не спрашивайте по памяти
- Требование указать страницу превращает ответ в проверяемый
- Персональные данные и коммерческую тайну в зарубежные сервисы не загружают
- Обезличивание решает большинство задач за пару минут
Проверьте себя
5 вопросов по материалу урока. Ответы сохраняются в вашем браузере.
1.Почему ответы по загруженному документу надёжнее ответов по памяти?
2.Зачем требовать указывать страницу или цитату в ответе?
3.Что произойдёт, если документ не помещается в контекстное окно?
4.Какие данные нельзя загружать в зарубежные облачные сервисы?
5.Что такое RAG?