Apprentissage par renforcement à partir de rétroaction humaine : alignement et post-entraînement des LLM
ANT
- Des schémas en couleur et des exemples concrets tout au long du texte.
- Écrit pour les lecteurs novices en la matière.
- Des séries de problèmes par chapitre avec des solutions complètes.
- Connectez ce bloc à un méta-champ de produit pour le faire varier par titre.
Livraison gratuite pour les éditions imprimées.
Découvrez une autre lecture captivante à ajouter à votre bibliothèque numérique.
Description
Recevez l'eBook gratuitement en enregistrant votre livre imprimé chez Manning.
« Une synthèse magistrale des racines intellectuelles du domaine et de ses outils pratiques. »
—Saurabh Sawant, Microsoft
Apprentissage par renforcement à partir des retours humains : L’alignement des LLM et le post-entraînement vous aident à comprendre comment les modèles d'IA modernes peuvent être adaptés pour mieux correspondre aux besoins et aux attentes de leurs utilisateurs. Plutôt que de passer en revue le vaste domaine de l'apprentissage par renforcement, Nathan Lambert, chercheur d'élite en IA, se concentre exclusivement sur le RLHF et son importance immédiate pour les modèles d'IA générative post-entraînement.
Ce livre concis va droit au but. Les premiers chapitres établissent l'aperçu de l'entraînement, expliquent le réglage fin des instructions et construisent des modèles de récompense fiables. Les chapitres du milieu abordent le cœur de l'alignement, explorant les algorithmes de gradient de politique de base, l'optimisation des préférences directes (DPO) et l'échelle au moment de l'inférence. Les chapitres suivants abordent la réalité complexe des données, vous guidant à travers la collecte de données de préférence, la génération de données synthétiques et les nuances de l'appel de fonction.
Au fur et à mesure, vous verrez comment ces méthodes de post-entraînement fonctionnent réellement, y compris leurs coûts de calcul uniques et leurs compromis de latence. Vous explorerez les modes de défaillance courants, tels que la sur-optimisation qualitative, le piratage de récompense et le manque de fiabilité des comparaisons d'évaluation externes. Des concepts difficiles comme la régularisation KL, l'optimisation de politique proximale et la modélisation de récompense générative sont clarifiés avec des expériences pratiques.
L'apprentissage par renforcement à partir des retours humains évite les détails académiques non pertinents au profit d'une valeur pratique immédiate. Tout ce que l'auteur Nathan Lambert inclut y figure parce qu'un projet RLHF moderne l'exige. Il explique habilement des pipelines de post-entraînement complexes en rendant chaque détail concret, connectant des abstractions isolées directement à l'objectif de rendre les modèles plus sûrs, plus intelligents et parfaitement adaptés à un style désiré.
Les dix-sept courts chapitres du livre présentent le matériel essentiel, tandis que des suppléments tels que les définitions de vocabulaire, la gestion des coûts de calcul, la variance d'évaluation et le suivi des performances d'entraînement apparaissent dans des annexes pratiques. Le résultat est un livre logiquement cohérent qui reste très navigable et techniquement approfondi sans s'enliser dans une théorie inutile.
Le livre couvre
• Les implémentations de base du RLHF et les algorithmes d'alignement direct
• La construction de pipelines robustes de données de préférence et de données synthétiques
• L'évaluation des modèles et la création de personas d'IA spécifiques
À propos du lecteur
Pour les ingénieurs confirmés, les scientifiques en IA et les étudiants qui cherchent à acquérir une base pratique dans l'alignement des modèles d'IA.
À propos de l'auteur
Le Dr Nathan Lambert est un chercheur en IA de premier plan, connu pour avoir dirigé le post-entraînement à l'Allen Institute for AI. Avec une expérience préalable chez HuggingFace, DeepMind et Meta, il est un ardent défenseur des modèles ouverts. Ses travaux visent à accroître l'accès et la compréhension de la technologie de l'IA, permettant aux lecteurs de contribuer à l'avancement de l'IA en dehors des laboratoires d'entreprise fermés.
Table des matières
Partie 1
1 Introduction
2 Une brève histoire du RLHF
3 Aperçu de l'entraînement
Partie 2
4 Réglage fin des instructions
5 Modélisation des récompenses
6 Apprentissage par renforcement
7 Raisonnement et mise à l'échelle au moment de l'inférence
8 Algorithmes d'alignement direct
9 Échantillonnage par rejet
Partie 3
10 La nature des préférences
11 Données de préférence
12 Données synthétiques
Partie 4
13 Utilisation d'outils et appel de fonctions
14 Sur-optimisation
15 Régularisation
16 Évaluation
17 Élaboration du caractère et des produits du modèle
A Définitions
B Au-delà du « simple style »
C Problèmes pratiques
Spécifications
Foire aux questions
Dois-je créer un compte pour télécharger ?
Non. Après l'achat, vous pouvez accéder à votre ebook directement depuis la confirmation de commande ou la page de téléchargement.
Que faire si un exemplaire arrive endommagé ?
Contactez-nous et nous vous aiderons à accéder au fichier ou vous fournirons un nouveau téléchargement si nécessaire.