Суть
Cerebras AI запустили внутреннюю базу знаний, которая обрабатывает более 15 тысяч запросов ежедневно. Инструмент стал одним из самых популярных в компании всего за три месяца. Главная особенность системы заключается в том, что она не заставляет сотрудников менять свои привычки, а собирает информацию из существующих рабочих сред, таких как Slack, GitHub и Jira.
Контекст
Проблема поиска корпоративной информации знакома многим быстрорастущим компаниям. Обычно ее пытаются решить созданием единого портала, куда всех заставляют переносить данные. На практике это редко работает. Люди продолжают обсуждать задачи там, где им удобно: в комментариях к коду, ветках мессенджеров или документах. Разработчики Cerebras решили пойти другим путем — они построили систему, которая адаптируется к привычкам людей, а не наоборот. Данные извлекаются из платформ напрямую, с минимальным вмешательством в рабочий процесс.
Детали
В основе архитектуры лежит единая таблица в PostgreSQL с использованием расширения pgvector. Туда стекаются данные из всех источников. Самым сложным и важным источником оказался Slack. Простой векторный поиск (embeddings) по сырому тексту показал плохие результаты.
Компании пришлось внедрить гибридный подход, включающий несколько методов:
- Полнотекстовый поиск для точного совпадения специфических терминов и кодов ошибок. Векторы часто "размывают" такие данные.
- Векторный поиск для понимания контекста и синонимов (когда вопрос и ответ написаны разными словами).
- Учет редкости слов (IDF), чтобы отсеивать неинформативные сообщения вроде "спасибо, попробую".
- Учет времени (age decay), отдающий приоритет свежим данным, так как старые инструкции быстро теряют актуальность.
Для обработки неструктурированных бесед применяется LLM-дистилляция. Большие языковые модели (LLM) анализируют ветку обсуждения и извлекают из нее структурированную информацию: суть вопроса, краткое резюме, итоговое решение и упоминания систем или кода. Именно этот нормализованный документ превращается в вектор. Дополнительно применяется техника "всплесков" (bursting), когда серия сообщений от одного автора объединяется и индексируется отдельно, чтобы не потерять важные детали, не попавшие в общее резюме.
Анализ
Подход Cerebras демонстрирует важный сдвиг в проектировании корпоративных систем искусственного интеллекта. Вместо того чтобы полагаться исключительно на модный векторный поиск, инженеры комбинируют классические методы информационного поиска с современными нейросетевыми технологиями. Использование LLM на этапе предварительной обработки данных (индексации), а не только при генерации финального ответа, значительно повышает качество поиска. Структурирование хаотичных бесед в понятные JSON-объекты перед векторизацией решает проблему "мусора на входе".
Перспектива
Вероятно, мы увидим стандартизацию подобного подхода в индустрии. Инструменты для создания внутренних поисковых систем (RAG-пайплайны) будут все чаще предлагать "из коробки" конвейеры нормализации данных с помощью LLM и сложные гибридные поисковые движки. Компании постепенно понимают, что качество поиска определяется не только алгоритмом ранжирования, но и тем, насколько хорошо сырые данные были очищены и структурированы перед попаданием в базу.