1.4 Pre-Training eines LLMs: Datenvorbereitung und Tokenisierung
Die Qualität und Leistungsfähigkeit eines Large Language Models (LLM) hängt entscheidend davon ab, wie das zugrunde liegende Trainingsmaterial ausgewählt und aufbereitet wird. Bevor wir Neuronale Netze erklären können, hilft es einen Einblick zu verschaffen, wie Daten aus dem Internet gewonnen, gefiltert und in eine für LLMs verständliche Form gebracht werden. Anschließend betrachten wir das Prinzip der Tokenisierung und zeigen, wie Tokens bei der Inferenz im neuronalen Netz verarbeitet werden.