Published signals

Affinage de LLM avec 1 000 échantillons : SFT + KTO pour la sortie structurée

Score: 7/10 Topic: Small dataset SFT + KTO fine-tuning for structured output generation

Apprenez à affiner un modèle de 9B paramètres sur un seul RTX 4090D avec seulement 1 000+ échantillons et une approche en deux étapes SFT + KTO pour générer des cas de test JSON structurés.

Ce guide présente une approche pratique pour affiner de grands modèles de langage avec un minimum de données. L'auteur utilise un modèle Qwen3.5-9B et un ensemble de données d'un peu plus de 1 000 exemples de haute qualité pour apprendre au modèle à générer des cas de test structurés au format JSON. Le processus comprend deux étapes : l'affinage supervisé (SFT) pour établir le comportement de base, suivi de l'optimisation KTO (Kahneman-Tversky) pour aligner les sorties du modèle sur les préférences humaines. L'ensemble du flux de travail fonctionne sur un seul RTX 4090D avec 24 Go de VRAM, démontrant que l'affinage avancé est accessible sans grand cluster. Les points clés incluent l'importance de la qualité des données par rapport à la quantité, les hyperparamètres qui ont fonctionné et les métriques d'évaluation utilisées. C'est une référence précieuse pour les équipes cherchant à personnaliser efficacement des modèles pour des tâches de sortie structurée spécifiques.