Cómo crear un pool de agentes low-code en Vertex AI

Resumen

Crear un pool de agentes low-code en Google Cloud es más simple de lo que parece: con Vertex AI Agent Platform puedes montar un agente recepcionista que delega tareas a subagentes especializados sin escribir código. Esta guía es para quienes empiezan con agentes de IA y quieren un flujo funcional en minutos.

La idea central es sencilla. Tienes un agente recepcionista que recibe todas las solicitudes del usuario, analiza la intención del prompt y decide si responde él mismo o transfiere la conversación a un especialista. Y aquí viene lo interesante: esa transferencia ocurre de forma automática, sin configuraciones extra.

Qué hace el agente recepcionista y por qué es el centro del pool

El recepcionista es la puerta de entrada. Su trabajo es leer lo que escribe el usuario y enrutar esa intención al subagente correcto [00:12].

Por debajo del recepcionista viven cuatro subagentes, cada uno experto en su rama:

  • Agente de pedidos, para consultas de estado de una compra.
  • Agente de devoluciones, para gestionar retornos.
  • Agente de recomendaciones, para precios y sugerencias de productos.
  • Agente de escalamiento, para casos que necesitan más atención.

Si escribes "deseo identificar cuánto cuestan unos audífonos", la intención cae en recomendaciones. Si escribes "quiero saber en qué estado va mi pedido", cualquier agente de la malla puede transferir al agente de pedidos [01:00].

¿Necesito configurar la transferencia entre agentes? No. Basta con describir en el system prompt del recepcionista en qué momento debe delegar cada tarea. El modelo entiende que tiene subagentes sin configuración adicional.

Cómo se construye el pool paso a paso en la consola

Todo empieza en la consola de Google Cloud. Verifica primero que estás parado en el proyecto correcto antes de tocar nada [02:20].

La ruta para llegar al constructor es directa:

  1. Busca Agent Platform y entra a Vertex.
  2. En el menú izquierdo, da clic en Studio.
  3. Ve a Agentes y luego a Crear agente.

Aunque la opción se llame "agente", en realidad estás creando un pool completo. Modificas el primer agente para convertirlo en recepcionista: le agregas nombre, descripción y las instrucciones [03:00].

Esas instrucciones son el system prompt. Todos los prompts vienen en los recursos de la clase. El del recepcionista es intencionalmente básico: incluye una sección de agentes disponibles y otra de reglas de negocio. Para prompting más complejo, la referencia es el curso de Prompt Engineer.

Cómo agregar los subagentes de forma gráfica

Agregar subagentes es literalmente dar clic en el botón de más. Aparece un nuevo subagente listo para configurar [05:00].

El primero es el agente de pedidos: le pones descripción y pegas sus instrucciones desde el documento de prompts. Repites el proceso para devoluciones, recomendaciones y escalamiento.

Cada subagente puede usar herramientas. Hoy solo existen dos disponibles:

  • Búsqueda directa en Google.
  • Exploración de contenido a partir de contextos de URLs.

Google irá sumando más con el tiempo. Cuando construyes agentes con el ADK, en cambio, eres tú quien programa las herramientas que usarán tus agentes [06:00].

Cuándo usar modelos Flash y cuándo modelos Pro

Aquí está una decisión clave de diseño. Google ofrece modelos Flash y modelos Pro, y elegir bien afecta la experiencia del usuario [04:00].

¿Cuál es la diferencia entre un modelo Flash y uno Pro? Los modelos Flash responden mucho más rápido y sirven para detectar la primera intención. Los Pro procesan tareas más pesadas, como consultar bases de datos o hacer análisis robustos, aunque tardan más.

La regla práctica que se aplica en la construcción: usa Flash para la primera interacción, donde quieres velocidad, y reserva Pro para cuando el usuario ya sabe lo que pidió y puede esperar.

En la práctica, el recepcionista quedó con un modelo Flash. En los subagentes se mezcló:

  • Pedidos, devoluciones y escalamiento con Gemini 2.5 Pro.
  • Recomendaciones con un modelo Flash.

Una vez definidos modelos y prompts, ya tienes todos los componentes listos para probar.

Cómo probar y desplegar el agente

Para ver el pool en acción, guarda el agente con un nombre (por ejemplo, agente recepcionista) y da clic en preview [08:00].

Es muy probable que la primera interacción arroje un error. No te alarmes: Google configura por detrás los permisos del usuario. Espera un poco y vuelve a intentar.

Cuando funciona, lo primero que revisas es quién contestó. Si escribes "quiero conocer qué cuestan unos audífonos", el recepcionista transfiere automáticamente al agente de recomendaciones, que continúa la conversación. Esa transferencia salió solo del prompting, no de una configuración manual [09:00].

Qué esperar del despliegue y los errores comunes

Con el agente funcional, das clic en deploy, le pones nombre e implementas. Un detalle importante: hoy solo es posible desplegar agentes low-code en una región específica dentro de Google Cloud [10:00].

¿Cuánto tarda desplegar un agente low-code? Entre cinco y diez minutos. El proceso puede fallar; si eso pasa, aparece un botón para reintentar hasta que el despliegue sea exitoso.

En el ejemplo, el despliegue falló dos veces y funcionó a la tercera. Es una circunstancia normal hoy, tanto en modo low-code como en modo ADK.

Para encontrar tu agente desplegado, vuelve al menú de plataforma de agentes, ve a Agentes y en la sección de escalar da clic en implementaciones [11:00]. Ahí queda tu agente construido y desplegado desde low-code.

Hasta aquí puedes interactuar con el agente, pero solo desde la consola. El siguiente reto es consumirlo desde una interfaz web para exponerlo a tus usuarios. ¿Ya pensaste cómo conectarías ese pool a tu propio frontend? Cuéntanos en los comentarios.