Noticias· 28 de septiembre de 2026

Agentes de voz con IA en España: comparativa y costes por minuto

El precio de gancho de 0,05 €/min oculta el TCO real de los agentes de voz con IA en España. Analizamos costes técnicos, cumplimiento RGPD y el impacto del AI Act.

Agentes de voz con IA en España: comparativa y costes por minuto

Un precio de 0,05 euros el minuto por un agente de voz con IA luce atractivo en la cuenta de resultados de cualquier comité de dirección. Es una cifra seductora, calculada sobre el volumen total de llamadas del contact center para justificar un ahorro inmediato. Sin embargo, esa cifra es apenas un reclamo comercial; carece de la infraestructura necesaria para gestionar un flujo real de voz, procesar las sutilezas del español peninsular o garantizar el cumplimiento del RGPD. En NextAI, tras auditar implementaciones reales en diversos sectores, hemos comprobado que el coste técnico operativo en producción se sitúa realmente entre los 0,10 y los 0,25 euros por minuto, una vez integrados la telefonía, la inferencia del modelo y la síntesis de voz. Este análisis no busca comparar tarifas de suscripción, sino diseccionar la pila tecnológica completa —telefonía, STT, LLM, TTS y marco legal— para que el responsable de la decisión pueda comprometerse a largo plazo con la seguridad necesaria ante el AI Act.

Diagrama técnico que desglosa el coste por minuto de un agente de voz mediante capas superpuestas

El hecho verificable: el mercado de voz IA se consolida en España en 2026

El hecho, primero, sin interpretación. El mercado de agentes de voz con IA en España ha pasado de ser terreno de pilotos aislados a un ecosistema con oferta estratificada: desde APIs de orquestación pura hasta soluciones gestionadas de extremo a extremo. Según el desglose técnico de Relinns AI Development Research, el coste acumulado de infraestructura —telefonía, ASR/STT, inferencia LLM y TTS— oscila entre 0,07 $ y 0,22 $ por minuto en producción (Relinns, 2026). Para el mercado español específicamente, Potenzzia sitúa el coste promedio por minuto entre 0,10 € y 0,13 €, con una estimación de 0,20 € a 0,40 € por llamada tipo (Potenzzia).

Eso es el hecho verificable, con fuente y cifra. La interpretación —y aquí NextAI se moja— es que la brecha entre el precio anunciado de las plataformas de entrada (0,03 $ a 0,05 $/min de orquestación bruta) y el coste real empaquetado (hasta 0,35 €–0,40 $/min en soluciones gestionadas) no es un error de comunicación. Es un modelo comercial. Las plataformas API cobran por lo que controlan —la orquestación— y dejan fuera, de forma deliberada o no, los costes de telefonía saliente/entrante, los tokens de modelos de alta gama y la ingeniería de integración que convierte un demo en un sistema en producción.

La decisión empresarial que cambia con este dato es sencilla de enunciar y difícil de ejecutar: dejar de comparar ofertas por el precio de la ficha técnica y empezar a exigir un desglose de capas antes de firmar. Quien no lo pide, paga la diferencia en la primera factura de tráfico real.

Qué no está confirmado (y por qué importa)

No hay, en las fuentes consultadas por el laboratorio, un estudio público que documente sistemáticamente la magnitud exacta de la divergencia entre precio de gancho y TCO real por proveedor nombrado. Lo que sí hay son rangos consistentes entre múltiples fuentes independientes que apuntan en la misma dirección: el coste base de orquestación (0,03–0,05 $/min) no incluye telefonía ni modelos de alta gama, y el coste empaquetado gestionado puede multiplicar esa cifra por seis o siete. Tampoco existe consenso documentado sobre si el modelo de facturación por minuto es superior al de suscripción con bolsas de minutos; ambos conviven en el mercado y la elección depende del volumen y la previsibilidad de la demanda de cada empresa. Presentamos esto como zona gris, no como certeza.

La pila real detrás del precio por minuto

Un agente de voz con IA no es un producto, es una cadena de cuatro eslabones que se ejecutan en tiempo real y cuya suma determina tanto el coste como la calidad de la experiencia. Romper cualquiera de ellos —una latencia alta en el ASR, un modelo de lenguaje sobredimensionado para la tarea, un TTS que no gestiona bien el barge-in— arruina la sensación de conversación natural, por barata que sea la orquestación.

La arquitectura de referencia que auditamos en NextAI conecta la centralita IP de la empresa (Asterisk, 3CX, Cisco, Mitel) vía SIP Trunking con un motor de orquestación multimodal que gestiona el turno de palabra en tiempo real (Aunoa AI). Esa orquestación decide cuándo el sistema escucha, cuándo interrumpe y cuándo cede la palabra, y ahí se juega buena parte de la percepción de calidad del cliente final.

Capa de la pilaFunciónRango de coste orientativo (por minuto)
Telefonía (SIP/DID)Conexión con la red telefónica y la centralita IPIncluido en el rango agregado de 0,07–0,22 $/min
ASR/STTTranscripción de voz a texto en tiempo realIncluido en el rango agregado de 0,07–0,22 $/min
Inferencia LLMRazonamiento y generación de respuestaVariable según modelo; principal palanca de coste
TTSSíntesis de voz natural con gestión de barge-inIncluido en el rango agregado de 0,07–0,22 $/min
Total producción (agregado)Pila completa en funcionamiento0,07 $ – 0,22 $/min (0,10 € – 0,13 €/min en España)

Fuente: Relinns AI Development Research; rango España según Potenzzia.

La lectura para un directivo no técnico es esta: cuando una oferta comercial cita un precio por minuto sin desglosar estas cuatro capas, o está subvencionando el margen con volumen —algo legítimo si se declara— o está dejando fuera partidas que aparecerán en la factura de producción. Ninguna de las dos opciones es mala en sí misma. Lo que es mala praxis es no saber cuál de las dos estás firmando.

Esta es también la razón por la que en NextAI insistimos en que un agente de voz nunca debería vivir como un silo conversacional aislado. Integrarlo con el Cerebro Empresarial —la memoria corporativa de la compañía construida con RAG y grafos de conocimiento que permite a cualquier sistema de IA razonar con el contexto real del negocio en lugar de con respuestas genéricas— cambia la ecuación de coste: el agente deja de necesitar un modelo de lenguaje sobredimensionado para cada llamada, porque el contexto relevante ya está indexado y disponible, y el coste de inferencia por minuto baja de forma medible.

Sin esa memoria, el agente de voz repite el mismo patrón que los chatbots de 2019: bien entrenado en el discurso, ciego ante la excepción real del cliente que llama por tercera vez con el mismo problema sin resolver.

Comparativa: plataformas y precios en el mercado de voz IA español

Vapi vs Retell AI vs soluciones gestionadas

Cuando un comité de dirección pregunta "Vapi vs Retell AI", en realidad está haciendo la pregunta equivocada. Ambas son capas de orquestación —potentes, flexibles, pensadas para equipos con ingeniería propia— pero ninguna de las dos resuelve por sí sola la telefonía, el alojamiento de datos en la UE ni el cumplimiento del AI Act. Son piezas de un puzle, no el puzle completo. Frente a ellas, el ecosistema español y europeo ofrece soluciones ya empaquetadas como Callsy, Aunoa o 008 Agent, que integran la pila completa a cambio de menos margen de personalización.

OpciónModelo de precioRango orientativo €/minAlojamiento UEIntegración SIPNivel de gestión
Vapi (orquestación API)Pago por uso, BYOK0,03 $–0,05 $ base + coste real de telefonía/LLM/TTSDepende del proveedor de modelo elegidoRequiere configuración propiaBajo: exige ingeniería interna
Retell AI (orquestación API)Pago por uso, BYOK0,03 $–0,05 $ base + coste real de telefonía/LLM/TTSDepende del proveedor de modelo elegidoRequiere configuración propiaBajo: exige ingeniería interna
Callsy / Aunoa / 008 AgentSuscripción o por minuto gestionado0,10 €–0,35 € según paqueteHabitual en oferta europeaConectores predefinidos (Asterisk, 3CX)Alto: llave en mano

Fuente: rangos agregados según Relinns AI Development Research y Callsy 2026 Buyer's Guide.

La diferencia práctica no es filosófica: es quién asume el riesgo de integración. Con Vapi o Retell AI, tu empresa compra piezas y contrata (o improvisa) la ingeniería que las une. Con una solución gestionada, pagas más por minuto pero trasladas ese riesgo al proveedor, siempre que ese proveedor documente dónde aloja los datos y cómo cumple el RGPD.

El ahorro real frente al agente humano

EscenarioCoste por minutoBarra proporcional
Agente humano (contact center)0,70 $/min██████████ 100 %
IA, precio de gancho (orquestación bruta)0,03–0,04 $/min█░░░░░░░░░ 5 %
IA, TCO real en producción (España)0,10–0,13 €/min███░░░░░░░ 18 %
IA, solución gestionada empaquetada0,35–0,40 $/min█████░░░░░ 55 %

Leyenda: cada barra representa el coste relativo tomando como referencia (100 %) el minuto de atención humana a 0,70 $. Fuente: Relinns AI Development Research y ContactShip.

Esta tabla es la que debería enseñarse en el consejo, no la del 0,05 €/min. El precio de gancho parece un 95 % de ahorro. El TCO real sigue siendo un ahorro notable —entre el 60 % y el 75 % frente al humano, según las mismas fuentes— pero es una cifra defendible ante auditoría, no una promesa de marketing.

La falacia del precio de gancho no está en el número, está en lo que calla: telefonía, tokens de modelo y la ingeniería que convierte un demo en un sistema que aguanta 10.000 llamadas al mes sin caerse.

Aquí es donde entra un concepto que en NextAI aplicamos de forma sistemática: el Superagente, entendido como un agente que se hace cargo de un proceso completo —agendar, cobrar, resolver una incidencia de principio a fin— y no solo de sostener una conversación puntual. Un agente de voz que solo conversa es un chatbot con micrófono. Un Superagente de voz cierra el proceso, actualiza el CRM y decide si necesita escalar a un humano. Esa diferencia se mide con el RAO (Ratio de Autonomía Operativa): de cada 100 llamadas que entran, cuántas terminan resueltas sin intervención humana. Un RAO del 60 % en atención al cliente es un proyecto rentable; un RAO del 20 % con la misma factura de infraestructura es un proyecto mal diseñado. Para entender la ecuación de coste completa frente al personal humano, conviene revisar el modelo TCO 2026 de agente humano vs. agente de voz IA.

Riesgo, seguridad y gobernanza: AI Act y RGPD

Dos frentes regulatorios conviven en cualquier despliegue de voz IA en España, y ninguno es opcional. El primero es el deber de transparencia del AI Act: el interlocutor tiene que saber, de forma inequívoca y desde el primer segundo de la llamada, que está hablando con un sistema de inteligencia artificial. No es un matiz legal menor, es un requisito de diseño de la conversación.

El segundo es el RGPD, y aquí el riesgo es más silencioso. Una llamada de voz genera una grabación y, frecuentemente, una transcripción biométrica. Si esos datos viajan a un servidor fuera del Espacio Económico Europeo, la empresa contratante —no solo el proveedor— asume responsabilidad ante una transferencia internacional ilícita. Exigir servidores en la UE y una política clara de retención de logs de audio no es un capricho de compliance, es la diferencia entre un proyecto sostenible y una sanción.

El propio ecosistema tecnológico español lo refleja: proveedores como Callsy, Aunoa o 008 Agent construyen su propuesta comercial explícitamente alrededor del cumplimiento por diseño de RGPD y de los requisitos de divulgación del AI Act (Callsy, Aunoa AI). Que un proveedor lo mencione en su web no exime de verificarlo contractualmente; antes de firmar conviene aplicar las 7 comprobaciones para verificar a un partner de IA.

En NextAI trasladamos esta exigencia al marco IMAN (Índice de Madurez AI-Native), cuyo eje de gobierno mide precisamente si la empresa tiene observabilidad continua sobre lo que sus sistemas de IA dicen, graban y retienen. Un agente de voz sin panel de auditoría de conversaciones es una caja negra regulatoria esperando una inspección.

Operación real en empresas españolas: de bots experimentales a Superagentes

La pyme o mid-cap española media no tiene un equipo de ingeniería de audio ni de IA dedicado. Ese hecho, más que cualquier tabla de precios, explica por qué las soluciones "Bring Your Own Key" —donde la empresa debe ensamblar Vapi o Retell AI con su propio proveedor de LLM y de TTS— generan tantos proyectos abandonados a mitad de camino. La complejidad operativa se come el ahorro teórico.

La alternativa que funciona en la práctica es la arquitectura empaquetada pero interoperable: conectores predefinidos con el CRM (HubSpot, Salesforce) y con la centralita existente, sin migraciones disruptivas que obliguen a tirar la infraestructura telefónica ya amortizada. Y cuando el agente no puede resolver, el traspaso a un humano debe hacerse por SIP Transfer contextualizado: el agente humano recibe el historial de la llamada, no un cliente frustrado repitiendo su problema desde cero.

Esta transición —de bot experimental a Superagente gobernado— es exactamente lo que en NextAI cartografiamos en la Ruta NEXT-5: cartografía del proceso, cerebro corporativo, superagentes, orquestación y gobierno, en ese orden. Saltarse la cartografía inicial es la causa más común de lo que llamamos Deuda de Contexto: el coste acumulado de tomar decisiones de IA sin haber mapeado antes cómo funciona realmente el proceso que se automatiza.

Pasos accionables antes de firmar cualquier contrato de voz IA:

  1. Auditar la pila completa propuesta por el proveedor, capa por capa: telefonía, STT, LLM, TTS.
  2. Exigir un desglose de coste por minuto en producción, no solo el precio de orquestación.
  3. Incluir cláusula contractual de soberanía de datos y alojamiento en el Espacio Económico Europeo.
  4. Solicitar una prueba de latencia real en español peninsular, con barge-in incluido, antes de firmar volumen.
  5. Definir por escrito el protocolo de handoff a humano vía SIP Transfer contextualizado.

Un integrador serio debería poder responder a estos cinco puntos sin rodeos; para distinguir a un partner de un simple revendedor de licencias conviene repasar qué debe aportar un integrador de IA en 2026.

Qué significa para tu empresa

La decisión correcta depende del volumen de llamadas, de la centralita heredada y de la exposición regulatoria del sector, no de quién ofrezca el euro más barato.

  • Pyme de servicios con bajo volumen (hasta 2.000 minutos/mes): una solución gestionada empaquetada (rango 0,20 €–0,35 €/min) suele salir más barata en TCO que montar ingeniería propia sobre Vapi o Retell AI, porque el coste fijo de integración se diluye mal en poco volumen.
  • Mid-cap con centralita heredada (Asterisk, 3CX, Cisco): prioriza proveedores con conectores SIP nativos ya probados; el coste de adaptar la centralita suele superar el ahorro de elegir la API más barata.
  • Corporación con volumen alto (más de 50.000 minutos/mes): aquí sí compensa evaluar orquestación propia sobre Vapi o Retell AI con equipo interno, siempre que se sume el coste real de telefonía, tokens y mantenimiento al comparar ofertas.

Los tres criterios de decisión que deberían aparecer en cualquier comité: volumen mensual de minutos, complejidad de integración con sistemas existentes y exposición regulatoria del sector (sanidad, banca y seguros exigen un nivel de auditoría de conversación superior al de un e-commerce).

Metodología y fuentes

El laboratorio de NextAI ha contrastado el desglose técnico de coste por capa de infraestructura con los datos específicos de mercado español, y ha cruzado ambos con la segmentación comercial del ecosistema europeo de proveedores gestionados para aislar la brecha entre precio de gancho y coste real. No se han empleado cifras de clientes propios en este análisis; todas las cifras citadas proceden de las fuentes públicas listadas.

Preguntas frecuentes

¿Cuál es el precio real de un agente de voz con IA en España?

El precio real en producción se sitúa entre 0,10 € y 0,13 € por minuto en la capa tecnológica, y puede llegar a 0,35 €–0,40 € por minuto en soluciones gestionadas de extremo a extremo. El precio de 0,05 €/min que anuncian algunas plataformas corresponde solo a la orquestación, sin telefonía ni modelos de alta gama.

¿Vapi o Retell AI, cuál elegir?

Ni Vapi ni Retell AI resuelven por sí solas telefonía, cumplimiento RGPD ni alojamiento en la UE: son capas de orquestación que exigen ingeniería propia. La elección entre ambas importa menos que decidir si tu empresa tiene equipo técnico para integrarlas o necesita una solución gestionada llave en mano.

¿Qué plataformas de voice AI operan en España con cumplimiento RGPD?

Callsy, Aunoa y 008 Agent son ejemplos de soluciones que integran conformidad con RGPD y transparencia del AI Act desde el diseño, incluyendo alojamiento en la UE. Antes de contratar, exige por contrato la ubicación exacta de los servidores y la política de retención de grabaciones de voz.

¿Cómo se calcula el coste por minuto real de un agente de voz IA?

Sumando telefonía SIP, reconocimiento de voz, inferencia del modelo de lenguaje y síntesis de voz, no solo la tarifa de orquestación anunciada. El rango agregado documentado es de 0,07 $ a 0,22 $ por minuto, con una media española de 0,10 € a 0,13 €/minuto según fuentes del sector.

Qué hacer con esto

El éxito en la adopción de voz IA no depende de la tarifa publicitaria, sino de la arquitectura aplicada. Exija a sus proveedores un desglose granular de costes por cada capa del servicio y calcule el TCO basándose en una llamada media de hasta 3,5 minutos; cualquier cifra inferior carece de rigor financiero. Asegúrese de incluir el alojamiento de datos en servidores de la Unión Europea y garantice que el sistema contemple el protocolo de handoff por SIP Transfer contextualizado. El éxito se mide mediante el ratio de automatización operativa, no por el volumen de interacciones. Automatizar procesos sin un mapa previo es el camino más rápido hacia una deuda de contexto inasumible. Solicite su Auditoría Digital y reserve 45 minutos de revisión técnica independiente.

¿Lo llevamos a tu empresa?

Nora te orienta. Nuestro equipo concreta tu proyecto.

Pedir auditoría · 290 € ↗
    [
    / 100 ]

    Tu empresa sabe más
    de lo que decide.

    qué construimos ↗ super apps ↗ superagentes ↗ cerebro empresarial ↗ ES EN
    Ecosistemas de IA empresarial
    Construimos el cerebro que lo reúne todo. Y los agentes que lo ponen a trabajar.
    PIDE TU AUDITORÍA DIGITAL
    Una hora. Sin presentación comercial.

    Cada herramienta guarda
    una parte.
    Ninguna ve el conjunto.

    Y se decide a ciegas
    sobre lo que ya se sabe.

    Lo llamamos Deuda de Contexto .
    EMPRESAS QUE YA CONFÍAN EN NOSOTROS
    Bioparc Fundación Bioparc De La Guía y Luzón Alumed La Tagliatella Semamcoin Transportes López Vialcanet Torrent CF Puchades KDOS Consulting Ludo Ciencia Gómez Avanza INCIBE Percent Subvia Bioparc Fundación Bioparc De La Guía y Luzón Alumed La Tagliatella Semamcoin Transportes López Vialcanet Torrent CF Puchades KDOS Consulting Ludo Ciencia Gómez Avanza INCIBE Percent Subvia

    Pero esto
    tiene solución.

    Cuatro formas
    de construirlo.

    01 Super apps Tu idea, funcionando.
    02 Superagentes Un proceso entero, sin ti.
    03 Ecosistemas Tus herramientas, hablándose.
    04 Cerebros empresariales Tu empresa, recordando.
    VER QUÉ CONSTRUIMOS
    A P P S
    A G E N T E S
    E C O S I S T E M A S
    Tu empresa funcionando
    como una sola inteligencia.
    Un cerebro. Unos datos. Una verdad.
    24/7
    agentes que
    no cierran
    UNA VERDAD
    la misma cifra
    para todos

    Empieza donde estés.

    Crece hasta donde quieras.

    Un agente. Después otro. Después el cerebro que los une.
    Ruta NEXT-5

    Una hora.
    Un mapa.