{"product_id":"reinforcement-learning-from-human-feedback-llm-alignment-and-post-training","title":"Apprentissage par renforcement à partir de rétroaction humaine : alignement et post-entraînement des LLM","description":"\u003cp\u003eRecevez l'eBook gratuitement en enregistrant votre livre imprimé chez Manning.\u003cbr\u003e\n \u003cbr\u003e\n « Une synthèse magistrale des racines intellectuelles du domaine et de ses outils pratiques. »\u003cbr\u003e\n —Saurabh Sawant, Microsoft\u003cbr\u003e\n \u003cbr\u003e\n Apprentissage par renforcement à partir des retours humains : L’alignement des LLM et le post-entraînement vous aident à comprendre comment les modèles d'IA modernes peuvent être adaptés pour mieux correspondre aux besoins et aux attentes de leurs utilisateurs. Plutôt que de passer en revue le vaste domaine de l'apprentissage par renforcement, Nathan Lambert, chercheur d'élite en IA, se concentre exclusivement sur le RLHF et son importance immédiate pour les modèles d'IA générative post-entraînement.\u003cbr\u003e\n \u003cbr\u003e\n Ce livre concis va droit au but. Les premiers chapitres établissent l'aperçu de l'entraînement, expliquent le réglage fin des instructions et construisent des modèles de récompense fiables. Les chapitres du milieu abordent le cœur de l'alignement, explorant les algorithmes de gradient de politique de base, l'optimisation des préférences directes (DPO) et l'échelle au moment de l'inférence. Les chapitres suivants abordent la réalité complexe des données, vous guidant à travers la collecte de données de préférence, la génération de données synthétiques et les nuances de l'appel de fonction.\u003cbr\u003e\n \u003cbr\u003e\n Au fur et à mesure, vous verrez comment ces méthodes de post-entraînement fonctionnent réellement, y compris leurs coûts de calcul uniques et leurs compromis de latence. Vous explorerez les modes de défaillance courants, tels que la sur-optimisation qualitative, le piratage de récompense et le manque de fiabilité des comparaisons d'évaluation externes. Des concepts difficiles comme la régularisation KL, l'optimisation de politique proximale et la modélisation de récompense générative sont clarifiés avec des expériences pratiques.\u003cbr\u003e\n \u003cbr\u003e\n L'apprentissage par renforcement à partir des retours humains évite les détails académiques non pertinents au profit d'une valeur pratique immédiate. Tout ce que l'auteur Nathan Lambert inclut y figure parce qu'un projet RLHF moderne l'exige. Il explique habilement des pipelines de post-entraînement complexes en rendant chaque détail concret, connectant des abstractions isolées directement à l'objectif de rendre les modèles plus sûrs, plus intelligents et parfaitement adaptés à un style désiré.\u003cbr\u003e\n \u003cbr\u003e\n Les dix-sept courts chapitres du livre présentent le matériel essentiel, tandis que des suppléments tels que les définitions de vocabulaire, la gestion des coûts de calcul, la variance d'évaluation et le suivi des performances d'entraînement apparaissent dans des annexes pratiques. Le résultat est un livre logiquement cohérent qui reste très navigable et techniquement approfondi sans s'enliser dans une théorie inutile.\u003cbr\u003e\n \u003cbr\u003e\n Le livre couvre\u003cbr\u003e\n \u003cbr\u003e\n • Les implémentations de base du RLHF et les algorithmes d'alignement direct\u003cbr\u003e\n • La construction de pipelines robustes de données de préférence et de données synthétiques\u003cbr\u003e\n • L'évaluation des modèles et la création de personas d'IA spécifiques\u003cbr\u003e\n \u003cbr\u003e\n À propos du lecteur\u003cbr\u003e\n \u003cbr\u003e\n Pour les ingénieurs confirmés, les scientifiques en IA et les étudiants qui cherchent à acquérir une base pratique dans l'alignement des modèles d'IA.\u003cbr\u003e\n \u003cbr\u003e\n À propos de l'auteur\u003cbr\u003e\n \u003cbr\u003e\n Le Dr Nathan Lambert est un chercheur en IA de premier plan, connu pour avoir dirigé le post-entraînement à l'Allen Institute for AI. Avec une expérience préalable chez HuggingFace, DeepMind et Meta, il est un ardent défenseur des modèles ouverts. Ses travaux visent à accroître l'accès et la compréhension de la technologie de l'IA, permettant aux lecteurs de contribuer à l'avancement de l'IA en dehors des laboratoires d'entreprise fermés.\u003cbr\u003e\n \u003cbr\u003e\n Table des matières\u003cbr\u003e\n \u003cbr\u003e\n Partie 1\u003cbr\u003e\n 1 Introduction\u003cbr\u003e\n 2 Une brève histoire du RLHF\u003cbr\u003e\n 3 Aperçu de l'entraînement\u003cbr\u003e\n Partie 2\u003cbr\u003e\n 4 Réglage fin des instructions\u003cbr\u003e\n 5 Modélisation des récompenses\u003cbr\u003e\n 6 Apprentissage par renforcement\u003cbr\u003e\n 7 Raisonnement et mise à l'échelle au moment de l'inférence\u003cbr\u003e\n 8 Algorithmes d'alignement direct\u003cbr\u003e\n 9 Échantillonnage par rejet\u003cbr\u003e\n Partie 3\u003cbr\u003e\n 10 La nature des préférences\u003cbr\u003e\n 11 Données de préférence\u003cbr\u003e\n 12 Données synthétiques\u003cbr\u003e\n Partie 4\u003cbr\u003e\n 13 Utilisation d'outils et appel de fonctions\u003cbr\u003e\n 14 Sur-optimisation\u003cbr\u003e\n 15 Régularisation\u003cbr\u003e\n 16 Évaluation\u003cbr\u003e\n 17 Élaboration du caractère et des produits du modèle\u003cbr\u003e\n A Définitions\u003cbr\u003e\n B Au-delà du « simple style »\u003cbr\u003e\n C Problèmes pratiques\u003c\/p\u003e","brand":"ANT","offers":[{"title":"Livre numérique","offer_id":54242170274160,"sku":"YSL3360","price":31.95,"currency_code":"EUR","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/1009\/8543\/8576\/files\/ebook_3360_ebcb86df57.jpg?v=1789563659","url":"https:\/\/antbook.store\/fr-fr\/products\/reinforcement-learning-from-human-feedback-llm-alignment-and-post-training","provider":"ANTBOOK","version":"1.0","type":"link"}