Segun MarkTechPost (AI/ML News), Cartesia ha presentado Sonic-3.6, la última versión de su tecnología de síntesis de voz en tiempo real. Este avance se produce tres meses después de la entrega de Sonic-3.5 y centra su mejora en la naturalidad del audio generado. El modelo logra posicionarse en el primer lugar en dos tableros de evaluación de calidad de voz: alcanza 1.283 puntos de Elo en el leaderboard de voz de proveedores y 1.123 en el de voz controlada. Este último resultado es particularmente significativo porque mide la calidad de síntesis independientemente del catálogo de voces, aplicando un escenario estándar en el que todos los modelos se prueban con los mismos ocho registros de voz. En este escenario, Sonic-3.6 lidera el desempeño, seguido por Sonic-3.5 y la versión v3 de ElevenLabs.
La arquitectura de Sonic-3.6 se basa en modelos de espacio de estado, en lugar de redes basadas en transformadores. Esta elección permite reducir el tiempo necesario para generar audio al primer instante (time-to-first-audio) por debajo de 90 milisegundos, mientras que el modelo de conversión de voz a texto, Ink-2, ofrece una latencia de 100 milisegundos. Ambas cifras son indicadas por el propio proveedor y no representan tiempos medidos en el entorno completo de uso. Actualmente, el modelo está disponible en fase beta y como API gestionada, pero no se ofrece en formato de pesos descentralizados. Es un modelo comercial cerrado, sin versiones abiertas ni repositorios en Hugging Face. Los usuarios deben contratar el servicio mediante tarifas que van desde niveles gratuitos para desarrolladores individuales hasta planes profesionales de $5, para empresas de crecimiento que operan centros de contacto a $49 y $299, y para entidades reguladas que requieren acuerdos de privacidad, contratos de uso y seguridad.
La aplicación de Sonic-3.6 es amplia, especialmente en sectores donde la interacción vocal es clave. Entre los usos destacados se encuentran agentes de soporte en línea, llamadas de cualificación, reemplazo de sistemas de voz en menús (IVR), recordatorios de citas y simuladores de capacitación para ventas. También se emplea en localización audio de contenidos, interfaces de voz dentro de aplicaciones y servicios de atención al cliente en plataformas SaaS.
Para los lectores peruanos, este avance representa una oportunidad real de mejorar la experiencia en servicios digitales. En un contexto donde las empresas del sector financiero, salud o comercio electrónico buscan integrar tecnologías que ofrezcan interacciones más humanas y rápidas, Sonic-3.6 ofrece una solución eficiente y de alto rendimiento. Aunque no está disponible para uso libre, su capacidad de generar voz natural en menos de un segundo puede transformar la forma en que los usuarios interactúan con aplicaciones locales, especialmente en entornos de atención al cliente o educación digital. El enfoque de Cartesia en equilibrar velocidad y calidad, más allá de los límites tradicionales, sugiere que el futuro de la voz artificial no está solo en el rendimiento técnico, sino en la capacidad de conectar con el usuario de forma auténtica y fluida.
