Введение в настройку предпочтений с SmolLM3
Добро пожаловать на модуль 3 самого маленького курса по дообучению! Эта часть познакомит вас с настройкой предпочтений с помощью SmolLM3, используя методы, которые мы изучали в модуле 1, касающемся инструкционного дообучения. Вы научитесь согласовывать языковые модели с человеческими предпочтениями с использованием прямой оптимизации предпочтений (DPO), чтобы создать более полезных, безопасных и честных AI-ассистентов.
После завершения данного модуля вы будете в состоянии согласовывать LLM с человеческими предпочтениями с помощью Direct Preference Optimization (DPO). Этот курс небольшой, но быстрый! Если вы хотите более плавный градиент, посмотрите The LLM Course.
После окончания данного модуля (и выполнения задания), не забудьте проверить свои знания, пройдя квиз!
Что такое настройка предпочтений?
Хотя супервизорное дообучение (SFT) учит модели следовать инструкциям и вести беседы, настройка предпочтений идёт дальше, обучая модели генерировать ответы, которые соответствуют человеческим предпочтениям. Это процесс создания AI-систем, более согласованных с тем, что хотят люди, а не буквальное следование инструкциям. В простых словах, это делает языковые модели лучше для реальных приложений.
Настройка предпочтений решает различные ключевые проблемы в разработке AI. Модели, обученные с настройкой предпочтений, демонстрируют улучшенное поведение в нескольких областях. Они реже генерируют вредоносные, предвзятые или неуместные ответы, а их вывод становится более полезным и релевантным для реальных потребностей людей. Такие модели дают более правдивые ответы, снижая при этом галлюцинации, и их ответы лучше отражают человеческие ценности и этические принципы. В целом, модели с настройкой предпочтений проявляют улучшенную согласованность, релевантность и качество ответов.
Для более подробного изучения методов согласования посмотрите оригинальную статью по DPO, в которой был впервые представлен DPO.
Прямая оптимизация предпочтений (DPO)
DPO преобразует настройку предпочтений, устраняя необходимость в отдельных моделях наград и сложных методах обучения с подкреплением. В данном модуле мы затронем этот ведущий метод для согласования языковых моделей с человеческими предпочтениями.
Система согласования DPO намного проще, чем система RLHF. Процесс состоит из двух основных этапов:
- Адаптация базовой модели для следования инструкциям через супервизорное дообучение.
- Прямая оптимизация модели с использованием данных предпочтений через Direct Preference Optimization.
Такой упрощенный подход позволяет обучаться на данных предпочтений без отдельной модели наград и сложных методов RL, при этом достигается сопоставимые или лучшие результаты. Не волнуйтесь, если вы сталкиваетесь с RLHF впервые: мы обсудим его подробнее позже в курсе и сравним с DPO.
Что мы построим
На протяжении этого блока вы будете развивать практические навыки в области выделения предпочтений через руки-на-опыте реализацию. Вы научитесь обучать SmolLM3 с использованием DPO на наборах данных с предпочтениями.
- Освоите настройку гиперпараметров DPO и техники настройки.
- Сравните результаты DPO с базовыми моделями, обученными инструкциями.
- Оцените безопасность модели и качество выравнивания при помощи стандартных контрольных точек.
- Отправьте свою выровненную модель на доску почёта курса.
- Наконец, изучите, как развертывать выровненные модели для практических приложений.
Готовы сделать ваши модели более сходимыми с человеческими предпочтениями с помощью DPO? Начнём!