Published signals

RTX 5090 vs 4090D pour QLoRA : un gain de 9 % du taux d'adoption et le goulot d'étranglement de la quantification 4 bits

Score: 7/10 Topic: QLoRA training on RTX 5090 vs 4090D

Un blog chinois rapporte que l'entraînement QLoRA de Qwen3.5-9B sur RTX 5090 (32 Go) atteint un taux d'adoption 9 % plus élevé que sur RTX 4090D (24 Go), attribuant cet écart à la perte d'informations due à la quantification 4 bits.

Un récent article de blog d'un développeur chinois fournit une comparaison pratique des performances de fine-tuning sur deux GPU grand public : la RTX 5090 avec 32 Go de VRAM et la RTX 4090D avec 24 Go. Le test impliquait l'entraînement de Qwen3.5-9B avec QLoRA, une méthode qui combine la quantification 4 bits avec des adaptateurs LoRA. Le résultat rapporté est une amélioration de 9 % du taux d'adoption (une métrique probablement liée à la qualité ou à l'acceptation des sorties du modèle) sur la RTX 5090. L'auteur explique cet écart en pointant le goulot d'étranglement informationnel créé par la quantification 4 bits : compresser des poids 16 bits en 4 bits perd inévitablement des informations, même avec la quantification NF4. Bien que la plus grande mémoire de la RTX 5090 permette une précision plus élevée ou des lots plus grands, l'article suggère que la quantification elle-même est un facteur limitant. Pour les ingénieurs ML et les équipes évaluant du matériel pour le fine-tuning, cela fournit un point de données utile, bien que la métrique spécifique et la méthodologie nécessitent un examen plus approfondi. L'article aborde également le compromis plus large entre l'efficacité mémoire et la qualité du modèle dans l'entraînement de type QLoRA.