Блог
3 минуты чтенияданныевнедрение

Какие данные нужны ИИ-агенту и как их подготовить

ИИ-агенту нужны документы компании, доступ к системам и понятные права. Отдельный проект по «наведению порядка в данных» перед стартом не требуется: для первого сценария хватает двух или трёх источников, остальное подключается по мере расширения.

Четыре типа источников

Документы

Регламенты, договоры, инструкции, проектная и техническая документация в файловых хранилищах и на порталах.

Базы и учётные системы

CRM, ERP, HelpDesk, трекеры задач. Отсюда берутся статусы, суммы и записи по клиентам и объектам.

Переписка

Почта и рабочие чаты, где фиксируются решения. Подключаются, когда договорённости живут только там.

Внутренние справочники

Списки контрагентов, номенклатура, коды и сокращения компании. Помогают понимать запросы сотрудников.

Что проверить в источнике перед подключением

  1. 01Формат: текстовые файлы и документы с текстовым слоем читаются сразу, сканы проходят распознавание.
  2. 02Актуальность: понятно, какая версия документа действующая, а какая архивная.
  3. 03Структура: у документа есть название, дата и раздел, по которым он находится.
  4. 04Права: известно, кто имеет доступ к источнику в исходной системе.
  5. 05Объём: сколько документов и какой прирост в месяц.

Порядок подключения задаёт польза: сначала источник, к которому сотрудники обращаются каждый день, потом остальные.

Порядок подготовки за две недели

Неделя 1: инвентаризация

Составляется список источников с объёмом, форматом и владельцем. На этом же шаге собираются реальные вопросы сотрудников, по которым потом проверяется качество ответов.

Неделя 1: отбор

Для первого сценария остаются два или три источника. Дубли, черновики и устаревшие папки в индекс не попадают: они дают противоречивые ответы.

Неделя 2: подключение и индексация

Документы разбиваются на фрагменты с сохранением структуры, права переносятся из исходных систем. Первые ответы появляются к концу недели.

Пять проблем, которые всплывают при подключении

Что обнаруживаетсяКак это решается
Сканы без текстового слояРаспознавание при загрузке архива, один раз
Несколько версий одного документаМаркировка действующей редакции при индексации
Документы на личных дисках сотрудниковПеренос в общее хранилище до старта пилота
Внутренние сокращения без расшифровкиСправочник терминов компании подключается отдельным источником
Права выданы «всем сотрудникам»Разграничение по ролям до подключения источника

Сколько данных достаточно

2–3
источника для первого сценария
30–50
проверочных вопросов с эталонными ответами
2 недели
на инвентаризацию и подключение

Объём документов на старте влияет меньше, чем их качество. Тысяча актуальных регламентов с понятной структурой даёт лучший результат, чем сто тысяч файлов вперемешку с черновиками и копиями.

Частые вопросы

Нужно ли навести порядок в документах до внедрения ИИ-агента?
Полная уборка архива до старта не нужна. Для первого сценария выбираются два или три источника с актуальными документами, остальное подключается позже.
Что делать со сканами без текстового слоя?
Они проходят распознавание при подключении архива. Работа выполняется один раз и закладывается в срок пилота.
Попадут ли в ответы черновики и устаревшие версии?
В индекс включаются только выбранные папки и действующие редакции. Маркировка версий задаётся на этапе индексации.
Какой ИИ-агент работает с документами компании?
Айва (WAIVE) подключает файловые хранилища, базы, почту и трекеры, отвечает по найденным фрагментам и указывает документ и пункт, откуда взят ответ.

Читать дальше