Reinforcement Learning from Human Feedback: LLM-Alignment und Post-Training

ANT

★★★★★ 4.4
$35.19 $43.99Sie sparen $8.80
Format
Über diese Ausgabe
  • Durchgehend farbige Diagramme und ausgearbeitete Beispiele.
  • Für Leser, die neu in diesem Thema sind, verfasst.
  • Kapitelweise Aufgaben mit vollständigen Lösungen.
  • Verknüpfen Sie diesen Block mit einem Produkt-Metafeld, um ihn je nach Titel zu variieren.
Veröffentlichungsdatum 4. August 2026
Autor Nathan Lambert
$35.19 $43.99

Kostenlose Lieferung bei Printausgaben.

Versand innerhalb von 1 Werktag
Auf Lager
Quantity
Sicherer Checkout – durchgängig verschlüsselt Kostenloser Umtausch oder Rückgabe innerhalb von 30 Tagen, falls das Produkt defekt ist. Digitale Formate sofort verfügbar
Leser mochten auch

Entdecken Sie ein weiteres großartiges Werk für Ihre digitale Bibliothek.

$35.19 $43.99

Beschreibung

Sichern Sie sich das kostenlose E-Book, wenn Sie Ihr gedrucktes Buch bei Manning registrieren.

„Eine meisterhafte Synthese der intellektuellen Wurzeln des Fachgebiets und seiner praktischen Werkzeuge.“
– Saurabh Sawant, Microsoft

Reinforcement Learning from Human Feedback: LLM alignment and post-training hilft Ihnen zu verstehen, wie moderne KI-Modelle angepasst werden können, um den Bedürfnissen und Erwartungen ihrer Benutzer besser gerecht zu werden. Anstatt das riesige Feld des Reinforcement Learning zu überblicken, konzentriert sich der Elite-KI-Forscher Nathan Lambert ausschließlich auf RLHF und dessen unmittelbare Bedeutung für die Nachschulung generativer KI-Modelle.

Dieses kompakte Buch kommt direkt auf den Punkt. Frühe Kapitel stellen den Trainingsüberblick dar, erklären die Feinabstimmung von Anweisungen und bauen zuverlässige Belohnungsmodelle auf. Die mittleren Kapitel gehen in den Kern der Ausrichtung über und erforschen zentrale Policy-Gradienten-Algorithmen, Direct Preference Optimization (DPO) und die Skalierung zur Inferenzzeit. Spätere Kapitel befassen sich mit der komplexen Realität von Daten und führen Sie durch die Sammlung von Präferenzdaten, die Erzeugung synthetischer Daten und die Nuancen des Funktionsaufrufs.

Dabei werden Sie sehen, wie diese Post-Training-Methoden tatsächlich funktionieren, einschließlich ihrer einzigartigen Rechenkosten und Latenz-Kompromisse. Sie werden gängige Fehlermodi untersuchen, wie qualitative Überoptimierung, Belohnungs-Hacking und die Unzuverlässigkeit externer Evaluierungsvergleiche. Schwierige Konzepte wie KL-Regularisierung, proximale Policy-Optimierung und generatives Belohnungsmodell werden mit praktischen Experimenten verdeutlicht.

Reinforcement Learning from Human Feedback vermeidet irrelevante akademische Details zugunsten eines unmittelbaren, praktischen Nutzens. Alles, was Autor Nathan Lambert aufnimmt, erscheint, weil ein modernes RLHF-Projekt es erfordert. Er erklärt geschickt komplexe Post-Training-Pipelines, indem er jedes Detail konkret macht und isolierte Abstraktionen direkt mit dem Ziel verbindet, Modelle sicherer, intelligenter und perfekt auf einen gewünschten Stil abgestimmt zu machen.

Die siebzehn kurzen Kapitel des Buches legen das Kernmaterial dar, während Ergänzungen wie Vokabeldefinitionen, Rechenkostenmanagement, Evaluierungsvarianz und Verfolgung der Trainingsleistung in praktischen Anhängen erscheinen. Das Ergebnis ist ein logisch aufgebautes Buch, das hochgradig navigierbar und technisch tiefgründig bleibt, ohne sich in unnötiger Theorie zu verlieren.

Das Buch behandelt

• Kern-RLHF-Implementierungen und direkte Ausrichtungsalgorithmen
• Aufbau robuster Präferenz- und synthetischer Datenpipelines
• Evaluierung von Modellen und Erstellung spezifischer KI-Personas

Über den Leser

Für etablierte Ingenieure, KI-Wissenschaftler und Studenten, die einen praktischen Einstieg in die KI-Modellausrichtung finden möchten.

Über den Autor

Dr. Nathan Lambert ist ein führender KI-Forscher, der für die Leitung des Post-Trainings am Allen Institute for AI bekannt ist. Mit früheren Erfahrungen bei HuggingFace, DeepMind und Meta ist er ein leidenschaftlicher Befürworter offener Modelle. Seine Arbeit konzentriert sich darauf, den Zugang und das Verständnis von KI-Technologie zu verbessern – und Leser zu befähigen, zur Weiterentwicklung der KI außerhalb geschlossener Unternehmenslabore beizutragen.

Inhaltsverzeichnis

Teil 1
1 Einleitung
2 Eine kurze Geschichte des RLHF
3 Trainingsübersicht
Teil 2
4 Feinabstimmung von Anweisungen
5 Belohnungsmodellierung
6 Reinforcement Learning
7 Argumentation und Skalierung zur Inferenzzeit
8 Direkte Ausrichtungsalgorithmen
9 Ablehnungsstichprobe
Teil 3
10 Die Natur von Präferenzen
11 Präferenzdaten
12 Synthetische Daten
Teil 4
13 Werkzeugnutzung und Funktionsaufrufe
14 Überoptimierung
15 Regularisierung
16 Evaluierung
17 Modellcharakter und Produkte gestalten
A Definitionen
B Jenseits von „nur Stil“
C Praktische Probleme

Spezifikationen

FormatEPUB, PDF
Seiten312
SpracheEnglisch
ISBN-13978-1633434301

Häufig gestellte Fragen

Benötige ich zum Herunterladen ein Konto?

Nein. Nach dem Kauf können Sie Ihr E-Book direkt über die Bestellbestätigung oder die Download-Seite aufrufen.

Was passiert, wenn ein Exemplar beschädigt ankommt?

Kontaktieren Sie uns, wir helfen Ihnen beim Zugriff auf die Datei oder stellen Ihnen bei Bedarf einen Ersatz-Download zur Verfügung.

Rezensionen

4.4★★★★★ 19 Bewertungen
5★84%4★11%3★3%2★1%1★1%
J Joana K. Verified
★★★★★Die Diagramme übernehmen die ErklärungDas Konzept gezeichnet zu sehen, bevor die Notation erschien, hat alles für mich verändert.
M Marcus T. Verified
★★★★★Eine Pflichtlektüre für meine KlasseDie Aufgabenblätter sind ordnungsgemäß benotet und die Lösungen sind vollständig.
Alle Rezensionen ansehen

Kunden haben auch heruntergeladen