GoogleMódulo campanas-voz· 1 de junio de 2026· 5 min lectura

Gemini 3.5 Flash y agentes complejos: qué significa para las PYMEs

Google presenta Gemini 3.5 Flash en Google I/O 2026: un modelo diseñado para tareas agénticas largas. Así afecta a las campañas de voz automatizadas para PYMEs.

Gemini 3.5 Flash y agentes complejos: qué significa para las PYMEs

Qué anunció Google en Google I/O 2026

El 29 de mayo de 2026, Google publicó "9 demos of Gemini Omni and Gemini 3.5 in action", confirmando dos familias de modelos distintas con objetivos muy diferentes. Gemini Omni se centra en la generación y edición de vídeo mediante lenguaje natural. Gemini 3.5 Flash, en cambio, está diseñado para algo más relevante para el mundo empresarial: ejecutar flujos de trabajo agénticos complejos y de larga duración con un rendimiento comparable al de modelos flagship, pero a la velocidad que caracteriza a la serie Flash.

El dato clave del anuncio no es el nombre del modelo, sino la arquitectura de uso: 3.5 Flash ya es el modelo por defecto en la app Gemini y en el modo IA de Google Search a nivel global, y su capacidad para orquestar subagentes colaborativos bajo supervisión lo convierte en el primer modelo de Google pensado explícitamente para automatización operativa a escala.

Qué cambia técnicamente con Gemini 3.5 Flash

Hasta ahora, los modelos Flash de Google eran rápidos y baratos, pero cedían terreno en razonamiento complejo frente a los modelos Pro o Ultra. Con 3.5 Flash, Google afirma haber cerrado esa brecha en dimensiones clave para agentes: planificación de pasos múltiples, mantenimiento de contexto largo y ejecución de subtareas en paralelo.

En las demos publicadas, el modelo ejecuta flujos como renombrar y categorizar activos no estructurados de forma dinámica, o generar interfaces de usuario completas en menos de 60 segundos desde AI Studio. Lo hace acoplado al framework Antigravity de Google, que actúa como arnés para desplegar subagentes colaborativos. La implicación práctica es directa: un modelo que razona bien y actúa rápido puede gestionar conversaciones telefónicas con lógica condicional sin degradar la experiencia del interlocutor.

Por qué esto importa en voz, no solo en texto

La mayoría de los casos de uso que se muestran en el anuncio son visuales o de texto. Sin embargo, la arquitectura subyacente —razonamiento en múltiples pasos, memoria de contexto, ejecución de acciones encadenadas— es exactamente lo que necesita un agente de voz para gestionar una llamada de recobro, confirmar una cita o completar una encuesta telefónica sin caer en respuestas genéricas o perder el hilo de la conversación.

Un agente de voz que usa un modelo con estas capacidades puede, por ejemplo, detectar que el interlocutor ha mencionado una objeción de precio, ajustar el guión en tiempo real, ofrecer una alternativa de pago y registrar el resultado en el CRM, todo dentro de la misma llamada y sin intervención humana. Eso antes requería modelos más grandes y lentos, o lógica de scripting muy rígida.

Cómo lo aprovechamos en phoneIA: módulo Campañas Voz

El módulo Campañas Voz de phoneIA.es lanza llamadas masivas con voz IA nativa en más de 30 idiomas. Las plantillas cubren recobro, agendamiento, seguimiento y revisiones técnicas. Los resultados —citas cerradas, respuestas recogidas, contactos no alcanzados— se exportan a CSV o se vuelcan directamente al CRM.

La evolución que habilita Gemini 3.5 Flash (y modelos equivalentes en la capa de razonamiento) es pasar de guiones lineales a conversaciones con ramificaciones reales. Hoy, una campaña de recobro puede seguir un árbol de decisión predefinido: si el contacto dice que ya pagó, la llamada termina y se marca como resuelta; si pide un aplazamiento, se ofrece una fecha alternativa. Con modelos agénticos de última generación, ese árbol puede crecer en tiempo real según lo que diga el interlocutor, sin que el equipo de operaciones tenga que anticipar cada variante posible en el diseño de la campaña.

Qué no cambia (y conviene dejarlo claro)

El anuncio de Google describe capacidades del modelo base. La integración concreta de Gemini 3.5 Flash en la capa de voz de phoneIA depende de la disponibilidad de la API, los costes por token y la latencia en streaming de audio, parámetros que Google no ha publicado en detalle para este modelo en el momento de escribir este artículo. Lo que sí es aplicable hoy es el principio de diseño: construir campañas de voz con lógica agéntica, independientemente del modelo subyacente, porque la infraestructura de phoneIA ya soporta esa arquitectura.

Ejemplo de uso para una PYME: gestoría con cartera de morosos

Imaginemos una gestoría con 400 clientes y una cartera de 60 facturas vencidas entre 30 y 90 días. El equipo administrativo tiene capacidad para hacer unas 20 llamadas diarias. Con Campañas Voz de phoneIA, esas 60 llamadas se pueden lanzar en una sola tarde, en el idioma de cada contacto, con un guión de recobro que incluye:

  • Identificación del deudor y referencia de la factura concreta.
  • Oferta de regularización inmediata con enlace de pago por SMS al finalizar la llamada.
  • Alternativa de aplazamiento con fecha comprometida registrada en el CRM.
  • Escalado automático a llamada humana si el contacto solicita hablar con un responsable.

El resultado exportable a CSV permite al responsable de administración revisar en diez minutos qué facturas están en vías de cobro, cuáles necesitan acción legal y cuáles simplemente no contestaron. Sin transcribir llamadas, sin tomar notas a mano, sin depender de que alguien del equipo tenga un hueco en la agenda.

Con la dirección que marca Gemini 3.5 Flash —modelos que razonan y actúan en flujos largos sin perder contexto—, ese mismo guión podría adaptarse en tiempo real si el cliente menciona que la empresa está en concurso de acreedores, o que ya envió una transferencia que no se ha procesado. La llamada deja de ser un script y se convierte en una negociación asistida por IA.

Conclusión

El anuncio de Google no es solo una demostración de capacidades de vídeo. La parte que más impacta en automatización empresarial es Gemini 3.5 Flash: un modelo que combina velocidad de respuesta con razonamiento agéntico de varios pasos. Para las PYMEs que ya usan o evalúan campañas de voz automatizadas, esto significa que el techo de lo que puede hacer una llamada IA sin intervención humana sube de forma significativa. El paso práctico ahora es diseñar campañas con lógica condicional real, no con árboles de decisión planos, y medir qué porcentaje de casos se resuelven sin escalar a un agente humano. Si quieres ver cómo está estructurado el módulo de llamadas masivas en phoneIA, ver el módulo Campañas Voz.

Fuentes

¿Quieres aplicarlo en tu PYME?

phoneIA.es integra estas tecnologías en módulos listos para usar: voz entrantes 24/7, campañas IA, CRM y mucho más.

Ver módulos