Краткий ответ

Граундинг (Grounding) — это разница между агентом, цитирующим утвержденную политику, и агентом, формулирующим нечто, что звучит правдоподобно. В Agentforce уровень граундинга состоит из четырех компонентов, которые строятся последовательно: какие источники объявлены источниками истины, как контент сегментируется и индексируется для извлечения, как сохраняются права доступа пользователя в момент запроса и что происходит, если подходящий источник не найден.

Большинство неудач, которые мы видим на пилотных проектах, не являются ошибками модели. Это неудачи базы знаний, которой никто не владел уже два года, документов, разрезанных посередине таблицы, и отсутствия пути отката (Fallback). Поэтому работа начинается с проверки готовности контента, а не с написания инструкций.

Широкий контекст выбора сценариев использования представлен в Agentforce для предприятий.

Четыре уровня граундинга

УровеньЧто определяетПризнак сбояПризнак успеха
ИсточникиКакие репозитории объявлены источниками истины и кто является их владельцемДва противоречивых ответа на один и тот же вопросСписок источников с владельцем и датой проверки
ПредставлениеСегментация (Chunking), метаданные и тегирование по продукту, языку и версииИзвлеченный фрагмент не относится к вопросуИзмерение Recall на известном наборе вопросов
РазрешенияКак контекст пользователя ограничивает извлечениеВнутренний контент появляется в ответе для клиентаПроверка Persona для каждого уровня разрешений
ПрозрачностьЦитаты, актуальность (Freshness) и путь отката (Fallback)Ответ без источника и без признания отсутствия знанийПроцент ответов с действительными цитатами

Уровень 1: Объявление источников истины

Первый шаг не технический. Берутся двадцать наиболее частых вопросов в выбранном процессе, и для каждого вопроса определяется, где находится правильный ответ в данный момент. Результат почти всегда удивителен: часть ответов находится в статьях базы знаний, часть — в поле CRM, часть — в документе у руководителя команды, а часть — в головах двух опытных сотрудников.

Для каждого источника, который включается в систему, должен быть назначен владелец, согласованная частота обновления и последняя дата проверки. Источник без владельца через несколько месяцев превращается в источник устаревшей информации, и агент будет продолжать цитировать его с уверенностью. Источники, у которых нет владельца, остаются вне системы, даже если они богаты контентом.

Сложное решение заключается в том, что не подключать. Репозитории электронной почты, каналы чата и презентации по продажам кажутся золотой жилой, но оказываются основным источником неверных ответов, потому что в них нет различия между черновиком, отклоненным предложением и утвержденной политикой.

Основы очистки и подготовки базы знаний подробно описаны в Готовность знаний для Agentforce.

Уровень 2: Сегментация (Chunking), метаданные и релевантность

Качество извлечения зависит меньше от модели и больше от того, как контент разбит. Резка по фиксированному количеству символов разрушает таблицы, списки шагов и условия допуска — именно тот контент, из которого извлекаются точные ответы. Предпочтительна резка по структуре: подзаголовок, этап процесса или строка таблицы, которая сохраняется целиком со своим контекстом.

Метаданные (Metadata) позволяют сузить область поиска еще до того, как модель вообще вступит в игру. Минимальный набор тегов, который следует требовать: продукт или линейка услуг, рынок или страна, язык, целевая аудитория (клиент или внутренний пользователь), срок действия и статус утверждения. Без тегирования рынка и языка агент в глобальной организации будет смешивать политики двух стран в одном ответе.

Проверка релевантности носит количественный, а не интуитивный характер: создается набор из 50-100 реальных вопросов с правильным ответом и правильным источником, и измеряется, в скольких случаях был извлечен правильный фрагмент. Низкий показатель Recall указывает на проблему представления, и ее решение намного дешевле, чем замена модели или переписывание инструкций.

Уровень 3: Разрешения в момент извлечения

Это уровень, который проваливает пилотные проекты при проверках безопасности. Правило простое: извлечение должно выполняться в контексте разрешений пользователя, а не в контексте широкой учетной записи интеграции. Если фрагмент информации был скрыт от пользователя в интерфейсе, он должен быть скрыт и из ответа агента.

На практике требуются три проверки. Во-первых, сопоставление между уровнями классификации во внешнем источнике и профилями (Profiles) и наборами разрешений (Permission Sets) в Salesforce. Во-вторых, проверка Persona: запускаются одни и те же десять вопросов от имени представителя, руководителя и внешнего клиента, а затем сравниваются ответы. В-третьих, обработка смешанного контента — документ, большая часть которого является публичной, а один абзац конфиденциален, должен быть вырезан или не должен быть включен.

В публичном канале безопасным по умолчанию является белый список: только контент, явно помеченный как разрешенный для клиента, попадает в индекс, доступный внешнему агенту. Подход с черным списком всегда пропустит один документ.

Модель ответственности между организацией, Salesforce и поставщиком модели подробно описана в Безопасность Agentforce и разделенная ответственность.

Уровень 4: Цитаты, актуальность (Freshness) и откат (Fallback)

Эти три механизма превращают агента из замкнутой системы в систему, которую можно проверять. Реальная цитата (Citation) ссылается на фактически извлеченный фрагмент, а не на статью, которую модель упоминает в тексте — это разница между доказательством и приукрашиванием. Процент ответов с действительной цитатой — один из немногих показателей, которые нетехнический руководитель может прочитать и понять.

Актуальность (Freshness) требует письменного SLA: политика ценообразования проверяется ежеквартально, процедуры обслуживания — раз в полгода, регуляторный контент — сразу после изменений. Контент, срок действия которого истек, должен автоматически удаляться из индекса, а не оставаться до тех пор, пока кто-то не заметит ошибку.

Откат (Fallback) — это поведение, которое важнее всего проверить перед тем, как предоставлять его клиентам. Агент должен явно сообщить, что у него нет подтвержденной информации, и передать запрос дальше, вместо того чтобы формулировать правдоподобный ответ. Хороший вопрос для тестирования: спросить о несуществующем продукте и посмотреть, придумает ли агент для него условия обслуживания.

Сценарий: Страховая компания с 900 статьями базы знаний

Страховая компания хотела, чтобы агент отвечал сотрудникам колл-центра на вопросы об условиях полисов. Первый пилотный проект провалился: 40% ответов были неточными или неполными. Анализ показал, что проблема полностью заключалась на уровне источников — из 900 статей 380 не обновлялись более трех лет, а 60 из них противоречили более новым статьям по той же теме.

Команда не трогала модель. Она сократила индекс до трех основных продуктов, всего около 140 статей, назначила владельцев для каждой линейки продуктов и архивировала противоречивые статьи. Были добавлены теги по продукту, году версии и статусу утверждения, и переход к сегментации по разделам вместо фиксированной длины.

Второй раунд тестирования на том же наборе из 80 тестовых вопросов достиг гораздо более высокой точности, и что более важно — в случаях, когда не было источника, агент передавал запрос человеку вместо того, чтобы угадывать. Вывод, который привел к расширению, был не "AI улучшился", а "мы знаем, на чем он основывается".

Риски и превентивные меры

РискКак обнаруживается поздноПревентивные меры
Противоречивые источникиРазные ответы на один и тот же вопрос у разных представителейАрхивирование старых версий и единый источник истины для каждой темы
Сегментация (Chunking), разрушающая структуруЧастичные ответы в многоэтапных процессахСегментация по разделам с сохранением заголовка контекста
Разрешения на уровне интеграцииРаскрытие внутренней информации клиентскому каналуИзвлечение в контексте пользователя и проверки Persona
Отсутствие срока действияЦитирование уже отмененной политикиSLA для обновления и автоматического удаления из индекса
Неопределенный FallbackФормулирование убедительного ответа без источникаПротестированный маршрут "нет подтвержденной информации" в каждой версии

Метрики для уровня граундинга (Grounding)

МетрикаОпределениеЧастота
Retrieval recallПроцент вопросов, для которых был извлечен правильный фрагментВ каждой версии
Citation validityПроцент ответов с существующим и действительным источникомЕженедельно
Content freshnessПроцент статей в индексе, соответствующих сроку действияЕжемесячно
Fallback rateПроцент запросов, переданных человеку при отсутствии источникаЕженедельно
Permission leakageКоличество обнаруженных утечек в проверках PersonaВ каждой версии

Высокий процент Fallback не является неудачей — это карта пробелов в контенте. Список вопросов, которые привели к Fallback, является наилучшим приоритетом для создания новых статей.

Если внутренней пропускной способности для создания контролируемого уровня граундинга недостаточно, сервис Agentforce и AI — это практический путь вперед.

Чек-лист перед подключением агента к источникам

  • ☐ Двадцать самых частых вопросов сопоставлены с текущим источником ответа
  • ☐ У каждого источника в индексе есть названный владелец и частота обновления
  • ☐ Противоречивые источники обнаружены и архивированы
  • ☐ Существует тегирование по продукту, рынку, языку, аудитории и дате истечения срока действия
  • ☐ Сегментация (Chunking) сохраняет таблицы и списки шагов
  • ☐ Извлечение выполняется в контексте разрешений пользователя
  • ☐ Выполнена проверка Persona для каждого соответствующего уровня разрешений
  • ☐ Существует набор из 50 тестовых вопросов с правильным ответом и источником
  • ☐ Цитаты (Citations) ссылаются на фактически извлеченный фрагмент
  • ☐ Маршрут Fallback сформулирован и протестирован на клиентском канале