База знаний по ссылке на сайт
Если часть информации о вашей компании живёт на сайте — описания услуг, характеристики, условия доставки и оплаты, ответы на частые вопросы, — её не нужно переносить в документы вручную. Укажите адрес, и система сама обойдёт страницы сайта и соберёт из них файл базы знаний, по которому ассистент сразу сможет отвечать.
Когда это полезно
- У компании есть сайт с подробным описанием товаров или услуг, но нет готовых документов.
- Информация часто меняется на сайте, а не в документах — обновить базу знаний можно одной кнопкой.
- Нужно быстро наполнить базу знаний клиента, не собирая файлы вручную.
Как добавить сайт
- Откройте панель «📄 Документы» и нажмите «🌐 Индексировать сайт».
- Введите адрес сайта: можно коротко —
example.com, или полной ссылкой —https://example.com/catalog/. - Нужна информация только из одного раздела (например каталога) — включите галочку «📂 Только этот раздел — постраничная индексация». Обойдутся лишь страницы под введённым адресом, и они попадут в отдельный файл: подробнее в разделе «Индексация одного раздела». Сразу под полем видно, какой файл получится и не пересекается ли он с уже проиндексированным.
- При необходимости измените лимит страниц (по умолчанию 300, максимум 1000). Для каталога товаров берите больше: разделы у каталогов многоуровневые, а карточки лежат в самой глубине.
- Оставьте включённой галочку «Уважать robots.txt» — это правило вежливого обхода, заданное владельцем сайта. Снимать её стоит только для собственного сайта.
- Нажмите «Индексировать». Окно можно закрыть: обход идёт в фоне, а страница чата остаётся рабочей.
Что происходит во время обхода
В панели документов появляется строка прогресса: «Обход сайта: страниц 12 из 300 · строк 940» и кнопка «Отменить». В режиме раздела в строке видно, какой раздел обходится. Перезагрузка страницы прогресс не сбрасывает — обход продолжается в фоне.
По завершении в списке документов появляется файл site_домен.txt (в группе «🌐 домен») — обычный текстовый документ:
- его можно открыть и отредактировать кнопкой ✏️, скачать ⬇️ или удалить 🗑️;
- система сразу переиндексирует базу знаний — обычно это занимает несколько секунд;
- в ответах ассистента этот файл указывается в блоке «Источники:», как и любой другой документ.
Если обход отменён или прерван, в файл попадает то, что успели собрать: ранее собранные страницы при этом не теряются, а файл и база знаний обновляются по собранному — ассистент сразу отвечает по актуальной версии файла.
Большие разделы: деление на подразделы
В один файл базы знаний помещается ограниченное число строк (10 000). Если раздел больше, он автоматически делится по подразделам: по файлу на подраздел, каждый со своей группой в «Документах» и своими эмбеддингами. Ассистент ищет по всем файлам сразу, поэтому деление на качество ответов не влияет — наоборот, поиск становится точнее.
Например, каталог из 1402 страниц разбился на 21 файл: отдельно «Диваны и кресла», отдельно «Шкафы и стеллажи», отдельно «Кровати и матрасы» и так далее; самая большая часть — 291 страница. Подраздел, который сам не влезает, делится на уровень глубже. Страница самого раздела (главная страница каталога) попадает в первый файл.
Сколько страниц влезает в один файл — зависит от плотности текста на страницах: у каталогов товаров это обычно 250–310 страниц. Всё, что не влезло в один файл, система раскидывает по подразделам, а не обрезает молча: обрезка возможна только тогда, когда дробить уже не на что (см. ниже).
План деления виден до запуска: при включённой галочке «Только этот раздел» в диалоге появляется предупреждение вида «Раздел большой (1402 страниц): будет разбит на 21 подраздел». Обход в этом случае идёт подразделами подряд, в строке прогресса видно «подраздел 3 из 21», а в конце все файлы попадают в базу знаний за одну переиндексацию.
Если раздел не на что делить (все его страницы лежат прямо в нём, подразделов нет), он обойдётся одним файлом, и часть страниц в него не попадёт — предупреждение об этом тоже показывается заранее. В этом случае раздел лучше добавить по более узкому адресу.
Индексация одного раздела: каталог, услуги, документация
Галочка «📂 Только этот раздел — постраничная индексация» превращает введённый адрес в границу обхода: берутся только страницы, путь которых начинается с этого адреса.
- Вводите
https://example.com/catalog/— обходятся страницы вида/catalog/..., включая подразделы и карточки внутри каталога. - Похожие адреса не затрагиваются:
/catalog-sale/,/catalogovyjи другие страницы с похожим началом остаются в стороне — сравнение идёт по целым частям адреса. - Результат — отдельный файл
site_example.com_catalog.txtсо своей группой «🌐 example.com · /catalog». Файл всего сайта при этом не изменяется. - У файла раздела своя кнопка ⟳ «Обновить с сайта»: обновляется только этот раздел, лимит страниц и robots.txt берутся из его собственного сохранённого обхода.
- Внутри файла страницы разделены строками вида
# Заголовок — адрес страницы, поэтому в ответах видно, с какой страницы взят факт.
Разделы можно индексировать по отдельности: каталог, услуги, доставка — каждый своим файлом. Для больших сайтов это удобнее: строк в каждом файле меньше, поиск точнее, обновление быстрее.
Важно про пересечение. Если этот же раздел уже входит в файл всего сайта, система предупредит об этом ещё до запуска обхода: одни и те же страницы окажутся в двух документах базы знаний, и в ответах возможны повторы. Обычно лучше выбрать что-то одно — либо индексировать весь сайт, либо дробить его на разделы.
Каталог товаров. Страницы разделов каталога — это в основном списки товаров, а описания и характеристики лежат в карточках, которые находятся глубже. Чтобы обход дошёл до карточек, ставьте лимит страниц с запасом и проверяйте файл. Цены и наличие из файла сайта не становятся «справочником цен»: для точных ответов о стоимости загружайте прайс-лист — см. «Прайс-листы и цены».
Как обновить информацию с сайта
Путей два. Обновить файл целиком — кнопка ⟳ «Обновить с сайта» в списке документов. Обновить только то, что изменилось — кнопка «🔍 Проверить изменения» в окне «🌐 Индексировать сайт», а следом «⬆ Обновить затронутые»; при этом страницы для проверки не обходятся вовсе, поэтому это быстрее.
Обновление файла: ⟳ «Обновить с сайта»
У файла сайта в списке документов есть кнопка ⟳ «Обновить с сайта» (у файла раздела — своя такая же кнопка: обновится только этот раздел). Нажмите её — система проверит страницы заново:
- изменившиеся страницы перечитываются;
- неизменившиеся берутся из кэша — обновление проходит быстро;
- новые страницы добавляются, а исчезнувшие уходят из файла;
- файл заменяется целиком, поэтому дубликатов документов не появляется;
- эмбеддинги пересчитываются только по изменившимся строкам — даже большой раздел обновляется за секунды, а не пересчитывается целиком;
- если ничего не изменилось, эмбеддинги не пересчитываются вовсе.
Кнопка ⟳ обходит весь файл, поэтому перед ней полезно узнать, изменилось ли что-то вообще, — за секунды это делает проверка.
Что изменилось: «🔍 Проверить изменения»
Кнопка в окне «🌐 Индексировать сайт». Она читает карту сайта (sitemap.xml), где у каждой страницы обычно указана дата последнего изменения, и сравнивает эту дату с тем, что уже лежит в базе знаний:
- дата новее нашего обхода — страница изменилась;
- страницы в базе знаний ещё нет — она новая;
- страница была взята из карты и из неё исчезла — она пропала (например, товар снят с продажи).
Страницы при этом не обходятся: проверка занимает секунды вместо минут. В отчёте видно, сколько страниц новых, изменившихся и пропавших, какие файлы это затрагивает и сколько страниц в каждом — с примерами адресов.
Проверка ничего не меняет: это только отчёт.
Обновление без лишнего обхода: «⬆ Обновить затронутые»
Кнопка становится активной после проверки и сразу показывает, сколько файлов затронуто. Система обойдёт заново только эти файлы и обновит их в базе знаний; остальные не трогаются вовсе. Переиндексация базы знаний выполняется одна на все обновлённые файлы, поэтому обновление двадцати частей каталога не растягивается на двадцать перезагрузок.
Перед запуском система сама перечитывает карту сайта — обход идёт по актуальному списку, а не по тому, что было на экране минуту назад. Настройки каждого файла берутся из его прошлого обхода: адрес, режим раздела и лимит страниц.
Нужно обновить что-то одно — нажмите ⟳ у конкретного файла в списке документов.
Что важно знать
- Проверка точна настолько, насколько сайт ведёт даты в карте. Если карты сайта нет или она без дат (
lastmod), система честно скажет, что сравнить нечем, — тогда обновляйте обычным обходом (⟳). - Страницы, о которых карта молчит (их находят по ссылкам внутри сайта), в проверке не участвуют: их изменения видно только при обычном обновлении. В отчёте такие страницы считаются отдельно — «без lastmod».
- Если лимит страниц файла меньше, чем нужно охватить, система поднимает его под объём изменений и сообщает об этом: молча обойти меньше, чем показала проверка, она не может. Верхний предел — потолок страниц; если и его не хватает, система об этом скажет.
- Обновление запускает пользователь — расписания нет: нажимаете кнопку, когда сами решите.
Что попадает в файл
- Основной текст страниц: заголовки, абзацы, описания, списки, содержимое таблиц.
- Без служебной обвязки: меню, «подвал», баннеры о cookie, формы и скрипты в базу знаний не попадают.
- Без повторов: одинаковые строки (шапка сайта повторяется на каждой странице) в файле остаются в одном экземпляре.
- Со ссылками внутри сайта: обходятся только страницы того же сайта, внешние ссылки не затрагиваются.
- Разделители страниц начинаются с символа
#и в поиск не попадают — они нужны, чтобы вам было удобно читать файл.
Ограничения
- Сайты на JavaScript. Если содержимое «рисуется» скриптами (одностраничные приложения, витрины на React/Vue), текста может собраться мало. Проверьте файл: если в нём нет нужной информации — загрузите документы вручную.
- Цены. Цены с сайта попадут в текст, а не в «справочник цен»: для точных ответов о стоимости таблицу лучше загрузить как прайс-лист — см. «Прайс-листы и цены».
- PDF-файлы сайта не разбираются — обходятся только страницы.
- Объём: до 300 страниц за один обход по умолчанию (максимум 1000) и до 10 000 строк в файле. Если строк больше, чем помещается, дробите сайт на разделы — так каждый файл останется в пределах лимита.
- Страницы с параметрами (
?PAGEN_1=2и подобные) считаются отдельными страницами, поэтому листинги с постраничной навигацией тоже расходуют лимит. - robots.txt: страницы, закрытые владельцем сайта от автоматического обхода, пропускаются.
- Проверка изменений опирается на карту сайта: если её нет или в ней нет дат изменения страниц, проверка честно сообщит, что сравнить нечем, — тогда файл обновляют обычным обходом (⟳). Страницы, которых в карте нет (они находятся по ссылкам), в проверке не участвуют: их изменения видно только при обычном обновлении.
- Разрешены только адреса
http://иhttps://; адреса внутренней сети система не обходит — это защита от нежелательных запросов.
Если текста собралось мало
- Проверьте, не сайт ли на JavaScript. Откройте файл сайта в редакторе ✏️ и посмотрите, есть ли в нём фразы со страниц. Если файл почти пуст — сайт отдаёт содержимое скриптами, здесь поможет только ручная загрузка документов.
- Укажите адрес раздела и включите галочку «Только этот раздел» — например,
example.com/uslugi. Обход не уйдёт за пределы раздела и не потратит лимит на остальные страницы сайта. - Увеличьте лимит страниц, если обход упёрся в предел: у большого каталога страниц заметно больше трёхсот.
- Дополните файл вручную — файл сайта обычный TXT: его можно открыть кнопкой ✏️ и дописать или исправить строки. Правила те же, что и для RAG-файлов: одна строка — один факт (см. «Документы и база знаний»).
Связанные разделы
- Документы и база знаний — форматы, загрузка, группировка, RAG-файлы.
- Загрузка прайс-листа — точные ответы о ценах.
- Частые вопросы — что делать, если ассистент не находит ответ.