Блог

Как подготовить корпоративный контент к внедрению генеративного ИИ: пошаговая инструкция

ИИ, хотя и является мощным инструментом, не понимает, какая информация корректна и актуальна, а какая уже устарела, и самостоятельно очистить документы от лишнего шума в процессе обработки данных и генерации ответа не сможет. Поэтому, помня о принципе «garbage in, garbage out», контент, который вы планируете отдавать ИИ для генерации ответов нужно предварительно подготовить.

Это самый первый и критично важный шаг при запуске любых проектов по внедрению генеративного искусственного интеллекта. В материале пошагово разберем, что именно нужно сделать и как.

Определиться со сценарием

Сначала нужно ответить на вопрос, для каких сценариев потребуется генеративный ИИ. Именно от этого будет зависеть, какой корпус информации вы соберете и какой контент будете затем очищать и готовить для дальнейшего использования ИИ.

Функционально можно выделить два основных сценария:
  • помощь пользователю в быстром поиске ответа на сложный вопрос — например, если ИИ используется для поддержки сотрудников контакт-центра или как селф-сервис инструмент для клиентов;
  • исследовательский сценарий — когда ИИ быстро анализирует большие объемы данных и помогает аналитику или эксперту в его работе.
С точки зрения области применения сценариев может быть множество:
  • работа с нормативной документацией — внутренние юридические документы, регламентирующие акты и другие материалы;
  • работа с маркетинговыми материалами — презентации, тексты для промо, лендингов и рассылок, которые на первом этапе генерирует ИИ, а затем дорабатывает маркетолог;
  • ответы на вопросы сотрудников компании — в этом случае понадобятся внутренние регламенты, правила распорядка, HR-документы и другие материалы.
Важно заранее прописать будущие сценарии работы и зафиксировать, какие именно документы потребуются, чтобы ИИ мог генерировать информацию и отвечать на вопросы.

Подготовить контент

После того, как вы определились со списком документов, можно приступать к подготовке контента.

Актуализация и очистка данных

На этом этапе нужно проанализировать выбранный контент, чтобы понять, на какие вопросы отвечают те или иные документы, какие данные и статьи устарели, найти дубли, несоответствия, определить, какие данные относятся к чувствительным.

Начать лучше с отбраковки устаревшего и неактуального контента. Эту задачу можно частично автоматизировать: например, подготовить скрипт, который будет находить документы с одинаковыми именами и отсортировывать более ранние версии, которые с высокой вероятностью уже потеряли актуальность. В ручном режиме документы помогут проверить владельцы контента или эксперты, которые подскажут, какие данные устарели, где нужно внести изменения.

Также важно обращать внимание на противоречия: случается, что информация по одному и тому же вопросу в разных источниках отличается. Часть таких расхождений заметна сразу — их нужно исправлять. Другие проявятся в ходе тестирования сценариев работы с ИИ. Поэтому в промте нужно сразу попросить ИИ указывать, какие источники он использовал, и отмечать, есть ли между ними расхождения.

Дополнительно документы нужно пометить в соответствии с ролевой моделью, принятой в компании, чтобы ИИ при работе с ними и при генерации контента на их основе учитывал политики доступа и не создавал брешей в безопасности.

Если в качестве хранилища контента используется современная База знаний, интегрированная с ИИ, то зачастую, эти вопросы решаются автоматически, для генерации ответов используются только актуальные версии документов, а черновики, архивные версии или документы недоступные конкретному пользователю выводятся из фокуса ИИ при отработке пользовательского запроса.

Если в компании активно используется внутренняя терминология, стоит также подготовить для ИИ отдельный словарь, чтобы он корректно понимал, что именно обозначают те или иные термины и аббревиатуры. Другой вариант работы с терминологией — дообучение языковой модели на внутренних материалах.

Редактирование контента

Следующий этап — корректировка и редактирование самого контента. Опираться нужно на два ключевых требования:
  1. Ясность текста для человека, его логичность и последовательность. Важно проверять не только сам текст, но и то, насколько понятны элементы, которые в нем используются: таблицы, диаграммы, блок-схемы, инфографика.
  2. Структура и оформление. Генеративный ИИ лучше работает с материалами, где есть иерархия заголовков, списки и другие элементы, позволяющие отделить одну мысль от другой и выделить важное.
Разумеется, тщательно редактировать каждый текст — большая нагрузка. Обычно в компании есть кластеры документов, которые стилистически и содержательно похожи друг на друга. Если в одном документе такого кластера заметен какой-то паттерн — например, слишком пространные или сложные формулировки, неудачно оформленные таблицы, — с высокой вероятностью он присутствует и в остальных материалах этого же кластера. Тогда нужно проверить весь набор документов.

«Шлифуется» контент уже на практике в тестовых кейсах: после получения первых ИИ ответов становится понятно, какие еще изменения нужно внести в контент, чтобы искусственный интеллект предоставлял более качественные ответы.

Структуризация

Следующий этап — структурирование информации. Здесь работу нужно вести по двум направлениям.
Первое — иерархическая структура. В компании уже, как правило, есть базовое деление на подразделения, области ответственности и типовые задачи, с которыми они работают. Задача на этом этапе — не придумывать структуру с нуля, а привести уже существующую информацию к более понятному и логичному виду.

Второе — сквозная ролевая/тематическая структура. Она зависит от конкретных сценариев использования генеративного ИИ. Важно понять, кто и для каких задач будет обращаться к системе, и на этой основе собрать нужные подборки материалов. Например, чтобы сформировать корректный ответ по тому, какие вклады или кредитные продукты доступны клиенту, ИИ потребуется само описание кредитных продуктов, регламентирующие внутренние документы, актуальные данные по ставкам и другим условиям. В иерархической структуре эти документы могут относиться к разным разделам, но при этом будут содержаться в одной подборке.

В результате получится двухуровневая модель: с одной стороны — разделы, категории и фильтры внутри предметной области, с другой — сквозная фильтрация, теги или подборки, которые будут привязаны к конкретным задачам и сценариям работы с ИИ.

Такой подход позволит сформировать “тематические” подборки документов по которым ИИ будет формировать свои ответы с минимальным риском возникновения “галлюцинаций”.

Определить владельцев знаний и то, как эти знания будут обновляться

Важная задача — назначить ответственных и экспертов, которые будут следить за актуальностью информации. На первом этапе внедрения с ними нужно будет согласовывать изменения в контенте или запрашивать их внесение, если модель начинает галлюцинировать или выдавать неточные ответы.

После полноценного запуска эти же люди должны участвовать в обновлении информации и контроле ее актуальности. В этой модели важно заранее определить, какие документы и как часто нужно актуализировать, какие материалы можно по расписанию отправлять в архив, а также как обрабатывать обратную связь от пользователей и анализировать активность использования документов.
Подробнее об этом мы рассказывали в статье о стратегии обновления контента в Базе знаний.

Где размещать контент

Если вы планируете использовать генеративный ИИ, чтобы помогать сотрудникам закрывать типовые задачи, поддерживать работу контакт-центра или анализировать большие массивы данных в исследовательских целях, лучшим решением станет База знаний с встроенным RAG.

Например, такой платформой является AI-портал InKnowledge. Он создан на основе Базы знаний и дает возможность подключать любые LLM-модели к решению. Такой платформой могут пользоваться и люди, и, как сервисом, другие системы. Это обеспечивает непротиворечивость информации и значительно упрощает поддержание ее актуальности.

При использовании AI-портала не требуется придумывать специальные технические средства для структурирования информации или отдельные интерфейсные решения, поскольку все необходимое уже предусмотрено. Дообучение ИИ, с привлечением дорогостоящих программистов и ML-инженеров, в таком сценарии не требуется, основная работа осуществляется контент-менеджерами. Важна и скорость реакции на изменения контента, т.к. в AI-портале это происходит практически моментально, после появления нового контента или изменения существующего ИИ сразу учитывает эти обновления при генерации ответов на вопросы пользователей. Кроме того, можно удобно контролировать версии контента и поддерживать его актуальность: если кто-то вносит изменения в документ, создается новая версия, и ИИ сразу начинает использовать именно ее.

Дополнительное преимущество — встроенный RAG, который «понимает» структуру хранения, версионность и политики безопасности, а также поддерживает подключение наиболее актуальных LLM-моделей для генерации ответов.

Если уже есть База знаний, что важно учесть

Во-первых, необходимо проверить актуальность документов, структуру и корректность изложения. Также важно понять, готова ли платформа к сквозной структуризации — то есть к тестированию документов в соответствии с планируемой бизнес-задачей.

По возможности лучше использовать решения, в которых уже встроен RAG и предусмотрена возможность подключения разных LLM-моделей. Это удобнее и более контролируемо, поскольку такое решение учитывает ролевую модель и понимает структуру базы знаний.

Если используется другое решение, важно учитывать риски возникновения уязвимости в безопасности: нередко ИИ обращается к документам от имени технического пользователя, которому доступны все ресурсы. В результате пользователь, у которого нет прямого доступа к данным, может получить к ним доступ через ИИ.

Еще один момент: если база знаний не имеет встроенного RAG, ИИ, как правило, не понимает структуру хранения внутри нее. Он работает со всем массивом документов и определяет релевантность только по содержимому, так как в таких случаях при подключении LLM обычно создается отдельная векторная база, которая учитывает тексты документов, но не видит их принадлежность к категориям, тегам и другим структурным признакам.

В такой ситуации можно пойти по пути репликации данных из одной системы в другую. Например, для одного из наших клиентов мы реализовали именно такую схему: документы из привычной базы знаний дублировали в AI-портал, который выполняет функции хранилища данных для ИИ. Это позволило нам выстроить иерархическую и ролевую структуру документов, назначить категории, теги и другие атрибуты, чтобы сузить выборку для ИИ.

Тестовый запуск и улучшение контента

Понять, насколько хорошо подготовлен контент, и довести его качество до нужного уровня поможет тестирование сценариев работы ИИ. Начинать лучше с небольшой предметной области: выбрать отдел или тему, на которой будет проверяться работа искусственного интеллекта, а также определить фокус-группу, которая будет оценивать этот контент.

По результатам тестирования фокус-группа должна заполнять файл, в котором будут фиксироваться вопросы пользователей, ответы ИИ и то, как именно участники хотели бы видеть ответ. В промте обязательно следует указывать, чтобы ИИ приводил источники информации — это позволит быстрее понять, что именно было не так: сам контент, структура базы или логика ответа ИИ.

После проведения первого тестового потока все файлы с комментариями собираются и анализируются, чтобы понять, где возникли сложности: возможно, проблема связана с промтом, а возможно — с самим контентом.

Например, в наших проектах мы проводим такой анализ, а затем готовим рекомендации по тому, как лучше адаптировать контент для ИИ. Эти рекомендации помогают как при доработке уже существующих документов, так и при создании нового контента. Кроме того, мы формируем рекомендации по тому, как правильно составлять запросы к ИИ.

После внедрения генеративного ИИ во всей компании особенно важно предусмотреть инструменты обратной связи, которые позволят отслеживать качество ответов. Для этого может быть достаточно простой системы лайков и дизлайков. Такой механизм помогает оперативно выявлять проблемы и работать с их источником, постепенно улучшая и контент, и качество ответов ИИ.

Вывод

Главное в подготовке контента для ИИ — не просто собрать нужные документы, а заранее привести их в порядок: убрать устаревшие файлы, устранить противоречия, продумать структуру информации и тематические подборки. Без этого этапа высоки риски галлюцинирования и неточных ответов.

Не менее важным является выбор платформы, в которой будет содержаться этот контент. Лучшим решением будет использование Базы знаний со встроенным RAG. В этом случае ИИ будет лучше понимать структуру хранилища, станет опираться на релевантные источники и работать не с разрозненными документами, а с управляемой основой, на которой можно строить более точные, безопасные и полезные ответы.
Управление знаниями Гайды и чек-листы Тренды AI