Система контроля качества AI-ответов
Feedback, журналы запросов, контрольные вопросы и verifier объединены в процесс, который помогает находить неподтверждённые ответы до релиза.
Задача
AI-функция может отвечать убедительно даже при слабом источнике или неверном поиске. Разрозненных ручных проверок недостаточно: после смены модели или промпта старые ошибки возвращаются.
Решение
Сбор воспроизводимых проблем
Пользовательская оценка связывается с вопросом, ответом, моделью, найденными источниками и trace. Негативные примеры превращаются в контрольные сценарии.
Проверка перед выпуском
Benchmark-набор запускается на новой версии. Verifier проверяет опору ответа на найденный контекст и блокирует результат, если утверждения нельзя подтвердить.
Результат
Ошибку можно повторить и сравнить
Команда видит плохой ответ вместе с входными данными, retrieval и версией модели.
Релизное решение опирается на набор проверок
Изменение промпта или поиска проходит одинаковые контрольные вопросы вместо выборочной оценки на глаз.
Стек
TypeScript · PostgreSQL · LLM API · RAG · Automated verifiers