© FM Forum Business Solutions GmbH
A-1200 Wien, Dresdner Straße 45
E-Mail: kundenservice@forum-media.at


drucken

Neu Dokument-ID: 1195872

Andrei Salajan | Praxiswissen | Fachbeitrag

1.4 Pre-Training eines LLMs: Datenvorbereitung und Tokenisierung

Die Qualität und Leistungsfähigkeit eines Large Language Models (LLM) hängt entscheidend davon ab, wie das zugrunde liegende Trainingsmaterial ausgewählt und aufbereitet wird. Bevor wir Neuronale Netze erklären können, hilft es einen Einblick zu verschaffen, wie Daten aus dem Internet gewonnen, gefiltert und in eine für LLMs verständliche Form gebracht werden. Anschließend betrachten wir das Prinzip der Tokenisierung und zeigen, wie Tokens bei der Inferenz im neuronalen Netz verarbeitet werden.

Maßgeschneidert für Ihren Erfolg: Profitieren Sie von der FORUM Media Online-Welt mit fundiertem Fachwissen, Top Suchergebnissen und vielen aktuellen Themenschwerpunkten.

Als Abonnent melden Sie sich bitte mit Ihren Zugangsdaten an, um auf den Inhalt zuzugreifen.
Oder bestellen Sie jetzt das OnlineBuch Künstliche Intelligenz in der Praxis in unserem Shop! Zum Shop