Разработчик-энтузиаст поделился деталями создания собственного инструмента RAG для локального поиска и анализа информации. Проект работает автономно на одном домашнем компьютере без использования сторонних облачных интерфейсов. Основой для системы послужила языковая модель Nemotron Nano 9B v2, запущенная с помощью библиотеки vLLM на новейшей пользовательской видеокарте GeForce RTX 5090.
Главной особенностью утилиты стал двухэтапный процесс обработки запросов. Сначала алгоритм извлекает ключевые слова на двух языках и параллельно ищет информацию в локальной базе SQLite FTS5 и поисковике DuckDuckGo. Затем пользователю предлагается самостоятельно выбрать наиболее релевантные источники из найденного списка перед генерацией итогового ответа. Такой подход позволяет избежать перегрузки контекста модели огромными массивами лишних данных и значительно повышает точность выдачи.
Вся серверная логика проекта уместилась в одном файле, а для работы автономных функций поиска используются официальные плагины от компании NVIDIA. При тестировании на флагманском графическом ускорителе система показала скорость от 80 до 120 токенов в секунду, формируя развернутый ответ по нескольким источникам примерно за пятьдесят секунд. Исходный код инструмента разработчик опубликовал в открытом доступе на портале GitHub для всех желающих.