Published signals

Feinabstimmung von LLMs mit 1k Stichproben: SFT + KTO für strukturierte Ausgaben

Score: 7/10 Topic: Small dataset SFT + KTO fine-tuning for structured output generation

Erfahren Sie, wie Sie ein 9B-Parametermodell auf einer einzelnen RTX 4090D mit nur 1.000+ Stichproben und einem zweistufigen SFT + KTO-Ansatz feinabstimmen, um strukturierte JSON-Testfälle zu generieren.

Dieser Leitfaden zeigt einen praktischen Ansatz zur Feinabstimmung großer Sprachmodelle mit minimalen Daten. Der Autor verwendet ein Qwen3.5-9B-Modell und einen Datensatz von etwas mehr als 1.000 hochwertigen Beispielen, um dem Modell beizubringen, strukturierte Testfälle im JSON-Format zu generieren. Der Prozess umfasst zwei Phasen: Überwachte Feinabstimmung (SFT) zur Etablierung des Basisverhaltens, gefolgt von KTO (Kahneman-Tversky-Optimierung), um die Ausgaben des Modells an menschliche Präferenzen anzupassen. Der gesamte Workflow läuft auf einer einzelnen RTX 4090D mit 24 GB VRAM und zeigt, dass fortgeschrittene Feinabstimmung ohne großen Cluster zugänglich ist. Zu den wichtigsten Erkenntnissen gehören die Bedeutung der Datenqualität gegenüber der Quantität, die Hyperparameter, die funktioniert haben, und die verwendeten Bewertungsmetriken. Dies ist eine wertvolle Referenz für Teams, die Modelle effizient für bestimmte strukturierte Ausgabeaufgaben anpassen möchten.