El ajuste fino de grandes modelos de lenguaje con LoRA es común pero a menudo un proceso de prueba y error. Este artículo presenta un enfoque estructurado, tipo árbol de decisión, para la optimización de hiperparámetros, basado en cuatro experimentos en Qwen3.5-9B. El autor varió sistemáticamente la tasa de aprendizaje, las épocas, el volumen de datos, el recorte de gradiente y el warmup, rastreando la pérdida final, la mejor pérdida y la precisión de tokens. Los hallazgos clave incluyen el impacto de la tasa de aprendizaje en la velocidad de convergencia y el papel del warmup en la estabilización del entrenamiento temprano. El marco de árbol de decisión ayuda a los profesionales a elegir el siguiente parámetro a ajustar según el comportamiento observado del entrenamiento, reduciendo la especulación. Aunque los números específicos dependen del modelo, la metodología es transferible a otras tareas de ajuste fino de LLM. Esta guía es especialmente útil para equipos nuevos en LoRA o aquellos que buscan optimizar sus pipelines de ajuste fino existentes.
Una guía práctica para la optimización de hiperparámetros LoRA para modelos Qwen, basada en cuatro experimentos de entrenamiento reales. Aprenda cómo la tasa de aprendizaje, las épocas, el volumen de datos y el warmup afectan la pérdida y la precisión de tokens.