Apprentissage par renforcement à partir de rétroaction humaine : alignement et post-entraînement des LLM

ANT

★★★★★ 4.4 2 104 évaluations ratings
€31,95
Format
À propos de cette édition
  • Des schémas en couleur et des exemples concrets tout au long du texte.
  • Écrit pour les lecteurs novices en la matière.
  • Des séries de problèmes par chapitre avec des solutions complètes.
  • Connectez ce bloc à un méta-champ de produit pour le faire varier par titre.
Date de publication 4 août 2026
Auteur Nathan Lambert
€31,95

Livraison gratuite pour les éditions imprimées.

Expédié en 1 jour ouvrable
En stock
Quantity
By placing your order you agree to purchase from Global-e as the merchant of record, subject to Global-e’s Terms and Conditions and Privacy Policy, and share your information with ANTBOOK.
Paiement sécurisé — crypté de bout en bout Échange ou retour gratuit dans les 30 jours si le produit est défectueux. Formats numériques disponibles instantanément
Les lecteurs ont aussi aimé

Découvrez une autre lecture captivante à ajouter à votre bibliothèque numérique.

€31,95

Description

Recevez l'eBook gratuitement en enregistrant votre livre imprimé chez Manning.

« Une synthèse magistrale des racines intellectuelles du domaine et de ses outils pratiques. »
—Saurabh Sawant, Microsoft

Apprentissage par renforcement à partir des retours humains : L’alignement des LLM et le post-entraînement vous aident à comprendre comment les modèles d'IA modernes peuvent être adaptés pour mieux correspondre aux besoins et aux attentes de leurs utilisateurs. Plutôt que de passer en revue le vaste domaine de l'apprentissage par renforcement, Nathan Lambert, chercheur d'élite en IA, se concentre exclusivement sur le RLHF et son importance immédiate pour les modèles d'IA générative post-entraînement.

Ce livre concis va droit au but. Les premiers chapitres établissent l'aperçu de l'entraînement, expliquent le réglage fin des instructions et construisent des modèles de récompense fiables. Les chapitres du milieu abordent le cœur de l'alignement, explorant les algorithmes de gradient de politique de base, l'optimisation des préférences directes (DPO) et l'échelle au moment de l'inférence. Les chapitres suivants abordent la réalité complexe des données, vous guidant à travers la collecte de données de préférence, la génération de données synthétiques et les nuances de l'appel de fonction.

Au fur et à mesure, vous verrez comment ces méthodes de post-entraînement fonctionnent réellement, y compris leurs coûts de calcul uniques et leurs compromis de latence. Vous explorerez les modes de défaillance courants, tels que la sur-optimisation qualitative, le piratage de récompense et le manque de fiabilité des comparaisons d'évaluation externes. Des concepts difficiles comme la régularisation KL, l'optimisation de politique proximale et la modélisation de récompense générative sont clarifiés avec des expériences pratiques.

L'apprentissage par renforcement à partir des retours humains évite les détails académiques non pertinents au profit d'une valeur pratique immédiate. Tout ce que l'auteur Nathan Lambert inclut y figure parce qu'un projet RLHF moderne l'exige. Il explique habilement des pipelines de post-entraînement complexes en rendant chaque détail concret, connectant des abstractions isolées directement à l'objectif de rendre les modèles plus sûrs, plus intelligents et parfaitement adaptés à un style désiré.

Les dix-sept courts chapitres du livre présentent le matériel essentiel, tandis que des suppléments tels que les définitions de vocabulaire, la gestion des coûts de calcul, la variance d'évaluation et le suivi des performances d'entraînement apparaissent dans des annexes pratiques. Le résultat est un livre logiquement cohérent qui reste très navigable et techniquement approfondi sans s'enliser dans une théorie inutile.

Le livre couvre

• Les implémentations de base du RLHF et les algorithmes d'alignement direct
• La construction de pipelines robustes de données de préférence et de données synthétiques
• L'évaluation des modèles et la création de personas d'IA spécifiques

À propos du lecteur

Pour les ingénieurs confirmés, les scientifiques en IA et les étudiants qui cherchent à acquérir une base pratique dans l'alignement des modèles d'IA.

À propos de l'auteur

Le Dr Nathan Lambert est un chercheur en IA de premier plan, connu pour avoir dirigé le post-entraînement à l'Allen Institute for AI. Avec une expérience préalable chez HuggingFace, DeepMind et Meta, il est un ardent défenseur des modèles ouverts. Ses travaux visent à accroître l'accès et la compréhension de la technologie de l'IA, permettant aux lecteurs de contribuer à l'avancement de l'IA en dehors des laboratoires d'entreprise fermés.

Table des matières

Partie 1
1 Introduction
2 Une brève histoire du RLHF
3 Aperçu de l'entraînement
Partie 2
4 Réglage fin des instructions
5 Modélisation des récompenses
6 Apprentissage par renforcement
7 Raisonnement et mise à l'échelle au moment de l'inférence
8 Algorithmes d'alignement direct
9 Échantillonnage par rejet
Partie 3
10 La nature des préférences
11 Données de préférence
12 Données synthétiques
Partie 4
13 Utilisation d'outils et appel de fonctions
14 Sur-optimisation
15 Régularisation
16 Évaluation
17 Élaboration du caractère et des produits du modèle
A Définitions
B Au-delà du « simple style »
C Problèmes pratiques

Spécifications

FormatEPUB, PDF
Pages312
LangueAnglais
Éditeur978-1633434301

Foire aux questions

Dois-je créer un compte pour télécharger ?

Non. Après l'achat, vous pouvez accéder à votre ebook directement depuis la confirmation de commande ou la page de téléchargement.

Que faire si un exemplaire arrive endommagé ?

Contactez-nous et nous vous aiderons à accéder au fichier ou vous fournirons un nouveau téléchargement si nécessaire.

Avis

4.4★★★★★ 19 évaluations
5★84%4★11%3★3%2★1%1★1%
J Joana K. Verified
★★★★★Les schémas sont l'outil pédagogiqueVoir le concept dessiné avant que la notation n'apparaisse a tout changé pour moi.
M Marcus T. Verified
★★★★★Un texte imposé pour mon coursLes séries de problèmes sont corrigées correctement et les solutions sont complètes.
Voir tous les avis

Les clients ont également téléchargé