La IA de voz está pasando de la demo a la producción, lo que significa que las pasarelas API deben manejar más que simples solicitudes HTTP. OctaFuse 2.4.0 aborda esto unificando el enrutamiento para los servicios de reconocimiento de voz (ASR) y síntesis de voz (TTS) de DashScope. La actualización soporta conversión síncrona, tareas asíncronas, respuestas de audio completas, flujos de audio continuos y comunicación WebSocket bidireccional para voz en tiempo real. Para los desarrolladores, esto significa que una configuración de pasarela puede gestionar diversos patrones de interacción de voz sin código personalizado. El lanzamiento destaca una tendencia más amplia: a medida que la voz se convierte en una interfaz estándar, la infraestructura debe adaptarse a sus requisitos únicos: sensibilidad a la latencia, datos en streaming y protocolos de transporte mixtos.
OctaFuse 2.4.0 añade enrutamiento unificado para los servicios ASR y TTS de DashScope, con soporte para modos síncrono, asíncrono, streaming y WebSocket. Señala la evolución de las pasarelas API hacia cargas de trabajo complejas de IA de voz.