Документы и база знаний
База знаний — это ваши документы, на основе которых ассистент отвечает на вопросы. Всё управление документами происходит в панели «Мои документы».
Как открыть панель
Нажмите «📄 Документы» в шапке чата. Панель откроется справа; закрыть её можно кнопкой ✕ или кликом по затемнённой области.
Поддерживаемые форматы
| Формат | Описание |
|---|---|
| Электронные документы и сканы (сканы распознаются, если OCR включён администратором) | |
| DOCX | Документы Word |
| XLSX | Таблицы Excel |
| CSV | Таблицы в текстовом виде |
| TXT | Обычный текст |
Загрузка документов
- В панели «Мои документы» нажмите на зону загрузки (или просто перетащите файлы в неё).
- Выберите один или несколько файлов — загрузка начнётся сразу.
- Дождитесь сообщения о завершении загрузки.
Полезно знать:
- Несколько файлов за раз — выбирайте все нужные файлы сразу или перетаскивайте пачкой.
- Повторная загрузка файла с тем же именем обновляет документ: старая версия заменяется новой, а не дублируется. Так удобно обновлять инструкции и прайсы.
- После загрузки система в фоне переиндексирует базу знаний — первые секунды поиск может идти по «старой» версии, но вскоре новые документы будут доступны для вопросов.
- Неподдерживаемые форматы (например, ZIP или изображения) не принимаются — система сообщит об ошибке.
Распознавание сканов (OCR)
Если администратор включил распознавание, страницы сканированных PDF без текстового слоя автоматически распознаются. Бумажный архив можно «оживить»: отсканируйте документы в PDF и загрузите — ассистент будет находить в них ответы. Если OCR не включён, такие страницы пропускаются — об этом можно уточнить у администратора.
Группировка по типам
Система автоматически определяет тип документа и раскладывает их по группам: 📖 Инструкции, 📄 Паспорта, 💲 Прайс-листы, 📁 Прочие документы и другие. Группа определяется по имени файла и содержимому.
- Включите переключатель «🗂️ По группам» в шапке панели — документы сгруппируются по типу.
- Выключите — увидите общий список.
- Прайс-листы всегда попадают в группу 💲 Прайс-листы (о них — в разделе «Прайс-листы и цены»).
Сортировка
В шапке панели есть выбор сортировки:
- По дате загрузки — свежие документы сверху (по умолчанию).
- По имени — алфавитный порядок.
Выбор запоминается между визитами.
Действия с документами
Для каждого документа доступны:
- ⬇️ Скачать — загрузить файл на компьютер.
- 🗑️ Удалить — удалить документ из базы знаний (система спросит подтверждение).
Документ с пометкой 📋 и числом — прайс-лист; число показывает, сколько позиций из него распознано.
Множественные действия
Отметьте галочками несколько документов — внизу панели появится панель действий:
- ☑️ Выбрать все / Снять — отметить или снять все документы.
- ⬇️ Скачать выбранные — скачать отмеченные файлы одним ZIP-архивом.
- 🗑️ Удалить выбранные — удалить отмеченные документы разом.
RAG-файлы: как улучшить индексацию документа
RAG-файл — это обычный TXT-файл, который вы создаёте сами, чтобы помочь системе лучше «понять» документ. Система не создаёт их автоматически — это ручной инструмент для тонкой настройки базы знаний.
Как это работает:
- Создайте TXT-файл с тем же именем, что и документ: например,
инструкция.pdf→инструкция.txt. - Загрузите его в базу знаний.
- При индексации система берёт текст из TXT-файла, а оригинал (PDF, DOCX и т.п.) остаётся на месте и доступен для скачивания.
Важные детали:
- В ответах ассистента источник показывается под именем оригинального документа (например,
инструкция.pdf), и по ссылке скачивается именно оригинал — даже если ответ найден в вашем TXT. - В списке документов такие TXT-файлы скрыты по умолчанию (пометка «RAG-файлы»), чтобы не засорять список. Переключатель «📄 Показать RAG-файлы» под списком показывает их — например, чтобы удалить лишний.
- Удалите RAG-файл — и система снова будет индексировать оригинальный документ.
Когда это полезно:
- PDF-скан без текстового слоя, когда распознавание выключено, — приложите свой TXT с текстом документа.
- Система извлекла из документа мало или «кривой» текст (битая кодировка, свёрстанные таблицы).
- Нужно дать системе «чистую» версию текста или дополнить документ фактами, которых в нём нет.
Как правильно составлять RAG-файлы
Текст TXT-файла попадает в базу знаний построчно: каждая непустая строка становится отдельным фрагментом для поиска. От того, как вы разобьёте текст на строки, напрямую зависит качество ответов.
Правила:
- Одна строка — один факт. Пишите полные, законченные предложения: «Доставка по Москве занимает 1–2 рабочих дня». Не разбивайте один факт на несколько строк и не склеивайте несколько фактов в одну строку.
- Самодостаточные строки. Строка должна быть понятна сама по себе, без ссылок на соседние строки («как указано выше», «см. п. 3»).
- Чистый текст, без мусора. Не включайте номера страниц, колонтитулы, оглавление, символы-разделители (
####,====), служебные пометки — весь текст строки попадает в индекс как есть. - Кодировка UTF-8. Сохраняйте файл в кодировке UTF-8 (стандартная для Блокнота Windows).
- Имя файла. Точно совпадает с именем документа, расширение —
.txt:каталог.pdf→каталог.txt. - Язык запросов. Формулируйте фразы так, как их задают пользователи: те же термины и синонимы («оплата», «рассрочка», «срок поставки»).
- Размер строки. Строка в 1–2 предложения ищется и сопоставляется лучше, чем абзац на полстраницы.
Пример правильного RAG-файла каталог.txt рядом с каталог.pdf:
Кресло офисное «Комфорт» поставляется в разобранном виде.
Срок поставки мебели — от 3 до 7 рабочих дней.
Доставка по Москве бесплатная при заказе от 30 000 ₽.
Гарантия на кресла — 18 месяцев с даты покупки.
Если в TXT-файле есть цены, помните: точные ответы на вопросы о ценах даёт отдельный механизм прайс-листов (XLSX/CSV) — см. «Прайс-листы и цены».
Изоляция базы знаний
У каждого пользователя — своя база знаний. Ваши документы, история и настройки не видны другим пользователям, и вы не видите чужие. Скачивание и удаление работают только с вашими файлами.