RAG через TokenTool: встроенная база знаний или внешний retrieval
TokenTool поддерживает два разных контура. Во встроенном режиме документы загружаются в базу знаний платформы, а RAG подключается к пресету или проекту; в Playground можно проверить найденные источники и диагностику. Во внешнем режиме ваше приложение само хранит документы и находит фрагменты, а TokenTool принимает уже собранный контекст для генерации через документированный текстовый API. Публичный embeddings endpoint для второго режима здесь не обещается.
Два режима, которые нельзя смешивать
Встроенный режим подходит, когда команда хочет управлять документами, базой знаний, пресетом и проектом внутри одного control plane. Платформа выполняет внутреннюю подготовку и retrieval для подключённой базы; в Playground доступны диагностика RAG и источники, по которым можно проверить ответ до интеграции.
Внешний режим подходит, когда у продукта уже есть собственное хранилище, разбиение, векторный индекс и правила доступа. Приложение возвращает ограниченный набор фрагментов и передаёт их модели через TokenTool для генерации. В этом варианте качество поиска, актуальность документов и разграничение прав остаются ответственностью вашего приложения.
Как выбирать LLM без выдуманных рейтингов
Сначала задайте измеримые ограничения: максимальный размер входа, язык документов, допустимое время ответа и бюджет одного запроса. Контекстное окно из каталога показывает технический предел, но не гарантирует качество на всём объёме. Сумма системной инструкции, истории, найденных фрагментов и ожидаемого ответа должна оставаться ниже этого предела.
Сравнивайте модели на одном закрытом наборе вопросов. Отмечайте, найден ли нужный фрагмент, поддержан ли вывод источником и признала ли модель отсутствие ответа. Страница не присваивает моделям способности по названию: учитываются только поля публичного каталога и результаты ваших собственных тестов.
Что входит в стоимость запроса
Для текстовой модели базовая оценка складывается из входных и выходных токенов. Вход включает инструкции, вопрос и все переданные фрагменты, поэтому добавление контекста влияет на цену сильнее, чем кажется по длине пользовательского вопроса. Если у модели есть пороговые тарифы для большого входа, расчёт должен применять актуальное правило каталога.
До разработки возьмите несколько реальных документов, измерьте типичный объём найденного контекста и проверьте сценарии в калькуляторе TokenTool. Это оценка, а не обещание списания: фактический тариф определяется в момент запроса.
Минимальный контур качества
Храните тестовый набор отдельно от данных, на которых настраивали поиск. Для каждого вопроса зафиксируйте ожидаемый источник и допустимый ответ. Проверяйте поиск и генерацию раздельно: модель не исправит ситуацию, когда нужный фрагмент не попал в контекст.
В production логируйте технические метрики без исходных секретов и лишних персональных данных: идентификатор модели, число токенов, задержку, код ошибки и версию шаблона. Полные документы и API-ключи в маркетинговую аналитику попадать не должны.
Порядок внедрения
- 01Выбрать режим: встроенная база знаний TokenTool или собственный retrieval-контур.
- 02Подготовить 20–50 реальных вопросов с подтверждёнными источниками.
- 03Во встроенном режиме загрузить документы, подключить базу к пресету или проекту и проверить диагностику в Playground.
- 04Во внешнем режиме настроить разбиение, метаданные, индекс и права доступа до подключения LLM.
- 05Выбрать 2–3 доступные модели по контексту и текущему тарифу.
- 06Сравнить качество ответов и стоимость на одном наборе запросов.
Перед запуском
- Выбран и документирован один из двух режимов RAG
- Источники видны пользователю
- Контекст не превышает лимит модели
- Поиск оценивается отдельно от генерации
- Секреты и документы не уходят в веб-аналитику
Что проверить отдельно
- Наличие модели в каталоге не доказывает качество именно на ваших документах.
- Встроенные embeddings внутри базы знаний не означают наличие публичного embeddings endpoint.
- TokenTool не подтверждает истинность загруженных документов: качество и права на источники проверяет владелец проекта.
Связанные задачи
Другие практические сценарии
Начните с измеримого теста
Выберите модель, оцените форму запроса и подключайте возможности по одной — с проверкой результата и расходов.