Cornerstone OnDemand, Inc. (Cornerstone) es líder mundial en soluciones de preparación de la fuerza laboral y presta servicios a 140 millones de usuarios en 186 países. La empresa creó un sistema de inteligencia artificial multiagente que transforma las operaciones de bases de datos, pasando de ser una lucha reactiva contra incendios a flujos de trabajo proactivos y autoorquestados. El sistema, denominado Orion AI, utiliza Amazon Bedrock y Strands Agents, un marco de organización de agentes de código abierto de AWS, para coordinar a los agentes especializados
.Antes de Orion AI, el equipo de Enterprise DataOps de Cornerstone dedicaba hasta 45 minutos por incidente de base de datos a consultar manualmente las vistas del sistema y a hacer referencias cruzadas de los registros antes de repartirlos entre los equipos. Con Orion AI, el diagnóstico de bases de datos se redujo de 45 a 10 minutos, lo que representa una reducción del 78%. Un equipo de tres personas entregó el sistema en seis meses
.En esta publicación, analizamos el problema operativo al que se enfrentó Cornerstone, cómo diseñaron Orion AI, los resultados que midieron y las decisiones de diseño que otros equipos pueden reutilizar.
El desafío operativo
Antes de Orion AI, el equipo de Enterprise DataOps de Cornerstone operaba de forma reactiva, con cuatro problemas recurrentes:
- Las investigaciones del rendimiento de las bases de datos tardaron aproximadamente 45 minutos por incidente y se distribuyeron en varias herramientas y vistas del sistema.
- Los flujos de trabajo del ciclo de vida de las bases de datos requerían 10 o más pasos manuales, desde el establecimiento de las conexiones hasta la comunicación de las actualizaciones de estado.
- Los informes entre el equipo de ingeniería de confiabilidad del sitio (SRE) y el equipo de datos se realizaron con un retraso de 15 minutos.
- Las alertas redundantes y superpuestas generaban un ruido que ocultaba las señales importantes.
En conjunto, esto significaba que los ingenieros dedicaban su tiempo a la coordinación manual en lugar de a resolver los problemas.
La solución: Orion AI
Orion AI es un sistema multiagente en el que un agente coordinador (el metaorquestador) delega el trabajo en agentes secundarios especializados organizados en una topología centralizada. Los ingenieros interactúan con él a través de una aplicación web, formulan preguntas y aprueban las acciones desde el mismo lugar en el que ya coordinan el trabajo operativo. Los agentes se ocupan de la supervisión de la infraestructura, el diagnóstico de las bases de datos, las operaciones del ciclo de vida de las bases de datos, el análisis de los clientes y el soporte basado en el conocimiento
.La creación se guió por dos principios: la privacidad de los datos mediante los controles de AWS en el marco del modelo de responsabilidad compartida y la integración profunda con las herramientas operativas existentes. Amazon Bedrock proporcionó acceso gestionado a los modelos básicos y Strands Agents proporcionó la capa de orquestación
.Resultados
La IA de Orion proporcionó mejoras cuantificables tanto en la velocidad como en la precisión del diagnóstico y liberó al equipo de la coordinación manual. Al automatizar los cuellos de botella manuales y agilizar los flujos de trabajo entre equipos, Cornerstone logró
los siguientes resultados.| Métrico | Antes | Después | Mejora |
| Tiempo de diagnóstico de base de datos | 45 minutos | 10 minutos | 78% más rápido |
| Pasos manuales del ciclo de vida | Más de 10 pasos | 1 interacción | Reducción del 70% |
Retraso en los informes del equipo de SRE a Data |
15 minutos | Instantáneo | En tiempo real |
| Alertas redundantes | Volumen de referencia alto | Filtrado | Reducción del 65% (mediana) |
Solución de problemas de rendimiento más rápida
La reducción del tiempo de diagnóstico de las bases de datos fue el mayor aumento de eficiencia de Orion AI hasta la fecha. Anteriormente, los ingenieros se conectaban manualmente a la instancia de SQL Server afectada, consultaban las vistas del sistema para ver las cadenas de bloqueo y los tipos de espera, hacían referencias cruzadas a los registros para aislar las consultas que llevaban mucho tiempo ejecutándose y correlacionaban las pruebas para formar una hipótesis sobre la causa principal. Este tiempo promedio era de aproximadamente 45 minutos por incidente.
Con Orion AI, tres agentes especializados comparten la investigación, cada uno de los cuales posee una fase distinta. Más allá del diagnóstico, Orion AI se encarga de solucionar los problemas: identificar la causa principal, recomendar la solución y crear un ticket completo de Jira asignado al ingeniero de guardia adecuado. Un traspaso manual de cuatro pasos
se divide en una sola interacción.Administración automatizada del ciclo de vida de las bases
Las tareas que antes requerían más de 10 pasos manuales, desde establecer conexiones a bases de datos hasta ejecutar consultas entre sistemas y comunicar las actualizaciones de estado, ahora se ejecutan como una única interacción en lenguaje natural. Orion AI identifica las herramientas y fuentes de datos correctas, ejecuta consultas en todos los sistemas, valida los resultados y devuelve una respuesta unificada. Desde la perspectiva del ingeniero, el trabajo se reduce a asesorar a Orion AI y validar los hallazgos de los
que informa.Monitorización en tiempo real y reducción de la fatiga por alertas
Orion AI eliminó el retraso de 15 minutos entre el equipo de SRE y los equipos de datos, sustituyendo las comprobaciones manuales periódicas por una visibilidad continua de todos los sistemas.
Orion AI redujo las alertas redundantes en una mediana del 65 por ciento mediante la deduplicación, el filtrado de umbrales y la correlación entre señales. De cada 10 alertas generadas anteriormente, ahora solo de 3 a 4 llegan a los ingenieros. Las alertas se envían directamente a los equipos responsables sin necesidad de una capa de alerta intermedia
.Principios clave de diseño
Tres decisiones dieron forma a Orion AI, y puedes aplicarlas a tus propios proyectos con múltiples agentes:
- Divida los agentes por dominio, no por complejidad de las tareas: cada agente incluye un conjunto reducido de integraciones de herramientas para un dominio operativo. De este modo, el modelo se centra en el contexto y mejora la precisión de la selección de herramientas, en lugar de pedirle a un agente de uso general que se encargue de todo.
- Por defecto, el enrutamiento por palabras clave, recurre a la búsqueda semántica: las solicitudes predecibles se comparan por palabra clave para mayor velocidad. Para mayor precisión, las solicitudes ambiguas recurren a la búsqueda semántica. Esto mantiene la latencia baja sin sacrificar la exactitud de las consultas más difíciles .
- Limite la memoria conversacional a las sesiones y omítala para obtener métricas en tiempo real: la memoria persistente admite conversaciones en varios turnos, pero las preguntas operativas siempre indican el estado actual del sistema. Omitir la memoria para obtener métricas en tiempo real ayuda a evitar que los datos obsoletos contaminen los diagnósticos en tiempo real.
Descripción general de la arquitectura
Orion AI se implementa como servicios en contenedores en Amazon Elastic Container Service (Amazon ECS). Los usuarios interactúan a través de una aplicación web que dirige cada solicitud al agente correspondiente, invoca las herramientas necesarias y recopila la respuesta. El siguiente diagrama muestra cómo se conectan estos componentes dentro de la nube de AWS
.Figura 1: Arquitectura de IA de Orion: un metaorquestador de Amazon ECS dirige las solicitudes a agentes especializados, que llegan a las fuentes de datos a través de un servidor MCP de Portal-Tools y utilizan Amazon Bedrock para la generación aumentada de modelos, memoria a largo plazo y recuperación
Análisis profundo de la arquitectura
Los principios de diseño anteriores se muestran de forma concreta en la arquitectura. El resto de esta sección describe los componentes principales de Orion AI
.Construyendo el patrón centralizado con Strands Agents
Orion AI expresa su topología con un puñado de primitivas de Strands Agents. La clase Agente es la piedra angular tanto para los agentes especializados como para los metaorquestadores. Las herramientas de cada agente son funciones comunes de Python marcadas con el decorador @tool. Esto deriva la especificación de una herramienta a partir de las sugerencias de tipo y la cadena de documentación de la función, lo que significa que no hay que mantener un esquema independiente. BedrockModel empaqueta el modelo de Amazon Bedrock en el que se ejecuta cada agente y MCPClient conecta los
La topología:
- El hub es un único agente de Strands que actúa como metaorquestador (el TaskExecutor).
- Los
spokesson instancias de agente independientes que se cargan de forma perezosa a través de un registro basado en decoradores. Cada una tiene su propio modelo, herramientas de dominio y un indicador de sistema localizado.
No contiene herramientas de dominio, solo herramientas de enrutamiento (find_relevant_agents, call_agent) y herramientas de control del flujo (emit_plan_step, emit_confirmation_gate) para poder analizar una solicitud paso a paso.
Durante el tiempo de ejecución, el hub invoca a un especialista por su nombre a través de la herramienta call_agent registrada. Cada especialista ejecuta su propio ciclo de búsqueda de herramientas y devuelve el texto sintetizado al hub, que reúne la respuesta final
Enrutamiento híbrido
Orion AI utiliza un enrutamiento que prioriza las palabras clave con una alternativa de búsqueda semántica. Aproximadamente el 80 por ciento de las consultas se resuelven mediante una ruta rápida de palabras clave en memoria en menos de un milisegundo. Cuando las palabras clave son insuficientes para determinar la intención, el sistema recurre a la búsqueda semántica con la tecnología de Amazon Titan Text Embeddings V2 para enrutar por significado. Para ver la disponibilidad de los modelos por región de AWS, consulte Modelos compatibles por región de AWS en Amazon Bedrock.
Cuando la invocación directa de la herramienta no es adecuada, se activa una cadena alternativa: Amazon Bedrock Knowledge Bases, la función de generación aumentada de recuperación (RAG) totalmente gestionada, recupera la documentación operativa para que las respuestas se basen en los procedimientos aprobados y no se generen sin contexto.
Los agentes de un dominio específico y sus límites
Orion AI usa 13 agentes de dominios específicos. Los tres agentes de SQL Server ilustran cómo la división de dominios se corresponde con las etapas de
una investigación real:- El agente de diagnóstico de bases de datos descubre las cadenas de bloqueo, los tipos de espera y las consultas de larga duración, y luego traduce los hallazgos técnicos en un impacto empresarial con recomendaciones de corrección. Responde: «qué está pasando y qué significa ».
- El agente de análisis del bloqueo de sesiones lleva a cabo investigaciones de varios pasos con modelos de razonamiento para asignar las cadenas de bloqueo a un bloqueador raíz. Responde «por qué ocurre esto y cuál es la causa principal», y ofrece recomendaciones priorizadas, desde la finalización inmediata de la sesión hasta soluciones arquitectónicas a más largo plazo .
- El agente de diagnóstico de SQL en tiempo real consulta las instancias de SQL Server directamente a través de la API DATAOPS de Cornerstone para analizar los datos de bloqueo en tiempo real y las sesiones con un alto nivel de CPU. Responde: «lo que es verdad en este momento ».
El resto de los agentes siguen el mismo principio de propiedad limitada: monitoreo de la infraestructura, análisis operativo, administración del ciclo de vida de las bases de datos, análisis de clientes, recuperación de conocimientos de libros de ejecución, enrutamiento de notificaciones, descomposición de consultas compuestas, resolución de oyentes de grupos de disponibilidad y calentamiento de conexiones de modelos.
Integración de herramientas y conectividad de servicios
Orion AI llega a las fuentes de datos a través de dos patrones:
- Protocolo de contexto modelo (MCP) para herramientas que comparten varios agentes (por ejemplo, diagnósticos de SQL en tiempo real). Una función Strands
@toolllama a unMCPClient a través de HTTP transmisible a un servidor MCPde Portal-Tools, que llega a SQL Server y a la API DATAOPS. La integración con Jira sigue el mismo enfoque mediante herramientas MCP externas de Atlassian .
El - SDK directo o la API REST invoca fuentes que no necesitan la interfaz MCP compartida. Esto incluye métricas y paneles, programaciones de llamadas y bases de conocimiento de Amazon Bedrock a través del AWS SDK para Python (Boto3).
Esta división significa que cada agente usa el mecanismo más ligero que se adapta a su fuente, mientras que el servidor MCP centraliza las herramientas que comparten varios agentes. Estas conexiones se ejecutan mediante TLS y las credenciales, como el token MCP y la autorización de la API REST, se proporcionan por solicitud, no se incluyen en el código del agente.
Memoria conversacional
Amazon Bedrock AgentCore, una plataforma para crear, conectar y optimizar agentes a escala con cualquier marco o modelo, proporciona la capa de memoria entre sesiones. Orion AI coordina el contexto a través de un administrador de memoria central que lee tres niveles en paralelo, cada uno con su propio
tiempo de espera y asignación de fichas.Orion AI coordina el contexto en tres niveles. La memoria a corto plazo mantiene el contexto de la misma sesión en Amazon DynamoDB, cifrado en reposo de forma predeterminada, junto con un resumen continuo de la conversación que Amazon Nova 2 Lite genera de forma asincrónica. La memoria a largo plazo permite la recuperación entre sesiones a través de la memoria AgentCore, una capacidad de Amazon Bedrock AgentCore, con nombres separados por ID de usuario. Al finalizar la tarea, Orion AI llama a create_event para activar la extracción, el resumen y la consolidación automatizados. Un tercer nivel, la memoria entre agentes, es un cuaderno de notas efímero en memoria que contiene los resultados de los pasos de los subagentes dentro de una sola
El administrador de memoria recupera datos de todos los niveles en un tiempo de espera máximo de 500 milisegundos frente a un presupuesto de 4.000 fichas, con el respaldo de la memoria caché utilizada menos recientemente. Cuando una solicitud se refiere al estado actual del sistema, los agentes omiten por completo la memoria y leen los datos en tiempo real, de modo que el contexto obsoleto no contamina diagnósticos en tiempo real.
Inteligencia artificial y barandillas responsables
Como la seguridad de DataOps depende de reglas específicas del dominio, como qué operaciones de base de datos son disruptivas, el equipo creó una lógica de protección personalizada en lugar de confiar en filtros de contenido genéricos. Orion AI aplica los controles en cuatro capas
:- Se introdujeron restricciones de seguridad de nivel rápido en el sistema de cada agente, lo que bloqueó las recomendaciones peligrosas (por ejemplo, la finalización de los procesos críticos de las bases de datos) y aplicó métodos no disruptivos.
- Un sistema de confirmación automático que detiene las operaciones destructivas hasta que el usuario las confirma en un plazo de cinco minutos. De forma predeterminada, se deniega cuando se agota el tiempo de espera.
- Módulos de protección personalizados para la validación de las entradas (límites de longitud, bloqueo rápido e inyección de SQL), la desinfección de las salidas (redacción de secretos e información de identificación personal), la limitación de velocidad, el control de acceso basado en funciones y el seguimiento de los costos por solicitud.
- Protección a nivel de enrutamiento que bloquea la respuesta a las consultas operativas desde la memoria, lo que obliga a ejecutar la herramienta en tiempo real para las preguntas del estado actual.
Observabilidad
Orion AI utiliza los servicios de observabilidad estándar de AWS para la supervisión y la depuración. Amazon CloudWatch proporciona métricas y registros estructurados para la confianza en el enrutamiento, la latencia y la actividad de invocación de los agentes. AWS X-Ray rastrea las llamadas distribuidas entre las ejecuciones de los agentes para obtener una visibilidad integral de la ruta de las solicitudes
.Lecciones aprendidas
Puedes reutilizar las decisiones de diseño que hicieron posible la IA de Orion. La división de los agentes por dominio permite a cada agente integrar herramientas de forma limitada sin sobrecargar el contexto de un solo modelo. El uso del enrutamiento por palabras clave de forma predeterminada con la búsqueda semántica como alternativa mantuvo la latencia baja sin sacrificar la precisión en las solicitudes ambiguas. Dirigir la memoria conversacional a las sesiones y omitirla para obtener métricas en tiempo real hizo que los diagnósticos en tiempo real fueran confiables
.El equipo también tomó decisiones pragmáticas sobre la infraestructura. Implementaron la computación en Amazon ECS porque Amazon Bedrock AgentCore Runtime, una funcionalidad de Amazon Bedrock AgentCore, no estaba disponible al inicio del proyecto, y ahora están evaluándolo como una opción de migración futura. Si está creando software hoy en día, evalúe la misma desventaja para su propio paquete: comience con lo que es estable y esté disponible ahora, y revíselo
a medida que vayan madurando las capacidades gestionadas.Conclusión
Orion AI redujo el diagnóstico de las bases de datos de 45 a 10 minutos, evitó el 70 por ciento de los pasos manuales del ciclo de vida y redujo el ruido de las alertas en un 65 por ciento. Un equipo de tres personas lo entregó en seis meses en Amazon Bedrock. Los patrones en los que se basan esos resultados son los mismos que otros equipos de operaciones pueden adoptar: agentes con ámbito de dominio, enrutamiento híbrido y memoria con ámbito de sesión sin tener en cuenta las métricas en tiempo real.
