NVIDIA тестирует диффузионные языковые модели для радикального ускорения генерации текста
Компания NVIDIA опубликовала на платформе Hugging Face новые коллекции моделей и наборов данных Nemotron-Labs, исследуя применение диффузионного подхода для сверхбыстрой генерации текста.

Суть
Компания NVIDIA опубликовала на платформе Hugging Face новые материалы в рамках проекта Nemotron-Labs. Главный исследовательский фокус этой публикации направлен на создание диффузионных языковых моделей. Этот подход потенциально способен обеспечить сверхбыструю генерацию текста, преодолевая фундаментальные ограничения современных нейросетей.
Вместе с моделями компания открыла доступ к обширным коллекциям наборов данных, которые использовались для предварительного обучения и тонкой настройки моделей семейства Nemotron.
Контекст
Большинство современных больших языковых моделей (LLM) работают по авторегрессионному принципу. Это значит, что они генерируют текст последовательно: слово за словом, токен за токеном. Такой подход обеспечивает высокое качество связности, но имеет жесткий предел скорости, так как каждое следующее слово зависит от предыдущего.
Диффузионные модели, напротив, изначально прославились в генерации изображений. Они создают результат целиком, постепенно «очищая» случайный шум до получения осмысленной картинки. Исследователи давно задаются вопросом: можно ли применить этот параллельный процесс к тексту, чтобы генерировать целые абзацы одновременно? Проект NVIDIA направлен именно на практическое решение этой задачи.
Детали
Опубликованные на Hugging Face ресурсы разделены на три ключевые коллекции. Первая включает семь внутренних диффузионных моделей серии Nemotron-Labs-Diffusion. Это экспериментальные веса, демонстрирующие текущий прогресс лаборатории.
Вторая коллекция содержит 12 масштабных наборов данных (Nemotron-Pre-Training-Datasets), которые применялись на этапе базового обучения моделей семейства Nemotron. Это фундаментальная база знаний нейросети.
Третья часть состоит из 28 наборов данных (Nemotron-Post-Training-v3), предназначенных для этапа тонкой настройки (post-training). Эти данные использовались для калибровки моделей Nemotron Nano и Super v3, помогая им лучше понимать инструкции пользователя.



