Reinforcement Learning
Определение
Обучение с подкреплением — метод машинного обучения, при котором агент учится принимать решения, получая награды или штрафы за свои действия.
Обучение с подкреплением — метод машинного обучения, при котором агент учится принимать решения, получая награды или штрафы за свои действия.
Это когда программа учится методом проб и ошибок: делает что-то, получает «хорошо» или «плохо» и постепенно становится лучше.
Применения RL:
Компоненты: агент, среда, состояния, действия, награды.
Трансфер обучения — перенос знаний, полученных моделью на одной задаче, для решения другой, родственной задачи, ускоряя обучение и улучшая результаты.
Подраздел AI, где алгоритмы учатся на данных и улучшают свои результаты без явного программирования.
Модель в ML — обученный алгоритм, который принимает входные данные и выдаёт предсказания или генерирует результат.
Фича (признак, feature) — входной параметр или характеристика данных, используемая ML-моделью для обучения и предсказаний.
Scaling Laws — эмпирические закономерности, связывающие производительность модели с её размером, объёмом данных и compute.
Mixture of Experts — архитектура нейросети, состоящая из множества специализированных подсетей (экспертов) и маршрутизатора, который направляет входные данные к наиболее подходящим экспертам.