Ejecutar grandes modelos de lenguaje en múltiples GPU no se trata solo de agregar tarjetas—se trata de elegir la estrategia de paralelización correcta. Este análisis desglosa dos enfoques dominantes: la división de capas, que distribuye las capas del modelo entre GPU y es en gran medida inmune al número de tarjetas, y el paralelismo tensorial, que divide tensores individuales y es altamente sensible al ancho de banda de interconexión. Para equipos con 3-4 GPU, la decisión depende de la topología del hardware: con NVLink rápido, el paralelismo tensorial puede ofrecer menor latencia; con PCIe, la división de capas a menudo evita el cuello de botella de comunicación. El artículo también compara vLLM, llama.cpp y TensorSharp, mostrando que la madurez del software y la optimización del kernel a menudo importan más que el número bruto de GPU. Lectura esencial para cualquiera que construya infraestructura de inferencia a pequeña escala sin clústeres masivos.
Una guía práctica para elegir entre división de capas y paralelismo tensorial para inferencia LLM multi-GPU, centrada en la sensibilidad de interconexión y las compensaciones del número de tarjetas.