Введение в Инструкционное дообучение с SmolLM3
Добро пожаловать на самый маленький курс по дообучению! Этот модуль проведет вас через процесс инструкционного дообучения с помощью SmolLM3, последней модели на 3 млрд параметров от LearnPath, которая демонстрирует передовые результаты для своего размера, оставаясь доступной для обучения и экспериментов.
к окончанию этого курса вы будете дообучать LLM с использованием SFT. Этот курс, маленький, но быстрый! Если вам нравится более плавный градиент, ознакомьтесь с The LLM Course.
После завершения этого учебного блока (и выполнения задания) не забудьте проверить свои знания с помощью квиза!
Что такое Инструкционное дообучение?
Инструкционное дообучение, это процесс адаптации предварительно обученных языковых моделей для следования инструкциям человека и ведения диалогов. В то время как базовые модели, такие как SmolLM3-3B-Base, обучены предсказывать следующий токен, инструкционно дообученные модели, такие как SmolLM3-3B, специально обучены для:
- точного следования инструкциям пользователя
- ведения естественных диалогов
- предоставления полезных, безопасных и честных ответов
- сохранения контекста в многокруговых взаимодействиях
- использования инструментов или серверов MCP для выполнения задач
Такое преобразование из модели завершения текста в помощника, следующего инструкциям, достигается с помощью контролируемого дообучения на тщательно отобранных обучающих наборах данных.
Мы более подробно рассматриваем инструкционное дообучение здесь в LLM Course.
Почему SmolLM3 подходит для обучения?
SmolLM3 идеально подходит для изучения инструкционного дообучения, потому что:
- она помещается на одной GPU по разумной стоимости
- обеспечивает конкурентоспособную производительность
- поддерживает многоязыковые разговоры
- поддерживает удлиннение контекста до 8k токенов (и некоторые варианты, до 128k токенов)
- имеет двухрежимное рассуждение с возможностями явного мышления
- поставляется с полными рецептами обучения, чтобы вы точно знали, как она была создана
Обзор модуля
В этом комплексном модуле мы рассмотрим четыре ключевые области:
Шаблоны диалогов
Шаблоны диалогов являются основой инструкционного дообучения: они структурируют взаимодействия между пользователями и моделями AI, обеспечивая последовательные и соответствующие контексту ответы. Вы научитесь:
- тому, как работает шаблон диалогов SmolLM3
- преобразовывать разговоры в необходимый формат
- работать с системными nhắcами и многокруговыми разговорами
- использовать встроенную поддержку шаблонов в библиотеке Transformers
Для подробной информации см. Шаблоны диалогов.
Контролируемое дообучение (SFT)
Контролируемое дообучение, это базовая техника адаптации предварительно обученных моделей для следования инструкциям. Вы овладеете:
Теория SFT и случаи ее использования
Работа с набором данных SmolTalk2
Использование SFTTrainer из TRL для эффективнойessian
Что вы построите
По окончании этого модуля вы:
- Прокачаете свою собственную модель SmolLM3 на наборе данных
- Поймете форматирование шаблонов чата и структуруconversation
- Получите опыт с потоками обучения программным иcommand-line способом
- Развернете модель в LearnPath Hub, которую смогут использоватьingleseo
- Получите базовые знания для болееtraining
techniques
Окунемся в увлекательный мирinstruction tuning!