Learnly
LLM Fine Tuning/Глава 2/Урок 1

Введение в обучение по инструкциям

Введение в Инструкционное дообучение с SmolLM3

Добро пожаловать на самый маленький курс по дообучению! Этот модуль проведет вас через процесс инструкционного дообучения с помощью SmolLM3, последней модели на 3 млрд параметров от LearnPath, которая демонстрирует передовые результаты для своего размера, оставаясь доступной для обучения и экспериментов.

к окончанию этого курса вы будете дообучать LLM с использованием SFT. Этот курс, маленький, но быстрый! Если вам нравится более плавный градиент, ознакомьтесь с The LLM Course.

После завершения этого учебного блока (и выполнения задания) не забудьте проверить свои знания с помощью квиза!

Что такое Инструкционное дообучение?

Инструкционное дообучение, это процесс адаптации предварительно обученных языковых моделей для следования инструкциям человека и ведения диалогов. В то время как базовые модели, такие как SmolLM3-3B-Base, обучены предсказывать следующий токен, инструкционно дообученные модели, такие как SmolLM3-3B, специально обучены для:

  • точного следования инструкциям пользователя
  • ведения естественных диалогов
  • предоставления полезных, безопасных и честных ответов
  • сохранения контекста в многокруговых взаимодействиях
  • использования инструментов или серверов MCP для выполнения задач

Такое преобразование из модели завершения текста в помощника, следующего инструкциям, достигается с помощью контролируемого дообучения на тщательно отобранных обучающих наборах данных.

Мы более подробно рассматриваем инструкционное дообучение здесь в LLM Course.

Почему SmolLM3 подходит для обучения?

SmolLM3 идеально подходит для изучения инструкционного дообучения, потому что:

  • она помещается на одной GPU по разумной стоимости
  • обеспечивает конкурентоспособную производительность
  • поддерживает многоязыковые разговоры
  • поддерживает удлиннение контекста до 8k токенов (и некоторые варианты, до 128k токенов)
  • имеет двухрежимное рассуждение с возможностями явного мышления
  • поставляется с полными рецептами обучения, чтобы вы точно знали, как она была создана

Обзор модуля

В этом комплексном модуле мы рассмотрим четыре ключевые области:

Шаблоны диалогов

Шаблоны диалогов являются основой инструкционного дообучения: они структурируют взаимодействия между пользователями и моделями AI, обеспечивая последовательные и соответствующие контексту ответы. Вы научитесь:

  • тому, как работает шаблон диалогов SmolLM3
  • преобразовывать разговоры в необходимый формат
  • работать с системными nhắcами и многокруговыми разговорами
  • использовать встроенную поддержку шаблонов в библиотеке Transformers

Для подробной информации см. Шаблоны диалогов.

Контролируемое дообучение (SFT)

Контролируемое дообучение, это базовая техника адаптации предварительно обученных моделей для следования инструкциям. Вы овладеете:

Теория SFT и случаи ее использования
Работа с набором данных SmolTalk2
Использование SFTTrainer из TRL для эффективнойessian

Что вы построите

По окончании этого модуля вы:

  • Прокачаете свою собственную модель SmolLM3 на наборе данных
  • Поймете форматирование шаблонов чата и структуруconversation
  • Получите опыт с потоками обучения программным иcommand-line способом
  • Развернете модель в LearnPath Hub, которую смогут использоватьingleseo
  • Получите базовые знания для болееtraining
    techniques

Окунемся в увлекательный мирinstruction tuning!

Сноски

AI-тест
1 / 5

Что такое инструкционное дообучение?