В какие часы нужно быть на связи?Какая компенсация за интернет?Что делать при болезни?Можно ли работать из другой страны?Какая столица Франции?
Найденные фрагменты
Как это работает
Документ режется на фрагменты ~600 символов с перекрытием; каждый кодируется моделью
sergeyzh/rubert-tiny-turbo в 312-мерный вектор и складывается в FAISS-индекс.
Вопрос кодируется тем же энкодером, ищутся ближайшие фрагменты по косинусной близости,
из лучшего извлекаются 1–2 предложения, наиболее близких к вопросу.
Метрики поиска на демо-документе (20 вопросов + 5 ловушек, app/eval.py):
—
recall@1
—
recall@3
—
MRR
—
отказы на ловушках
Честные оговорки:
Это извлечение, а не генерация: ответ — предложения из документа, внешний LLM не используется.
Если ни один фрагмент не похож на вопрос (близость ниже порога), сервис отвечает
«в документе этого нет», а не цитирует наименее нерелевантное.
Eval-вопросы написаны автором документа и лексически ближе к тексту, чем реальные
формулировки людей — на живых данных метрики будут ниже.
Метрики оценивают поиск (нашёлся ли нужный фрагмент), а не качество извлечённого ответа.