Implementa un flujo de trabajo de aprendizaje automático escalable mediante Oracle AI Data Platform y OCI Data Science
La solución combina las fortalezas de ambas plataformas:
- Plataforma de datos de IA: proporciona gestión de datos centralizada y controlada, procesamiento de Spark a gran escala, orquestación de flujos de trabajo y una arquitectura de datos de medallones.
- Data Science: proporciona un entorno de tiempo de ejecución flexible y una infraestructura para el desarrollo de aprendizaje automático basado en blocs de notas y trabajos, el despliegue de modelos y el servicio de modelos para cargas de trabajo de producción.
Esta arquitectura está diseñada para admitir plataformas de datos empresariales centralizadas, procesamiento de datos a gran escala, cargas de trabajo de aprendizaje automático a mediana y gran escala y colaboración entre ingenieros de datos y científicos de datos.
Los casos de utilización habituales incluyen:
- Previsión minorista: generación de previsiones de demanda diarias basadas en datos históricos y recién ingeridos.
- Optimización de la renovación de seguros: optimización de los precios de renovación de seguros para maximizar los márgenes y satisfacer las restricciones empresariales. Cada semana se genera un nuevo lote de ofertas de renovación.
- Control de eventos de registro de telecomunicaciones y detección de cambios: análisis de flujos de eventos operativos a gran escala para detectar cambios en los datos, identificar anomalías y generar informes y estadísticas diarios.
Arquitectura
En este diagrama se ilustra esta arquitectura de referencia.

Descripción de la ilustración Aidp-ml-workloads-architecture.png
helpp-ml-workload-architecture-oracle.zip#GUID-73867B97-5BE4-434A-85C4-097DB840B323
La arquitectura se divide en cuatro dominios principales.
Plataforma de datos de IA (AIDP)
La plataforma de datos de IA es responsable de la ingestión, transformación, gobernanza y preparación de datos.
- Integración de datos: ingesta de datos de diversos orígenes empresariales mediante diversas herramientas como OCI Data Integration y OCI Streaming con Apache Kafka
- AI Lakehouse: almacenamiento escalable y dinámico
- Flujos de trabajo de Spark: Procesamiento y transformación de datos escalables mediante la arquitectura de medallones con capas Bronze, Silver y Gold
- Flujo del agente: interacciones de datos en lenguaje natural
Estos recursos los crean y gestionan principalmente los ingenieros de datos.
Plataforma Data Science
Data Science gestiona el ciclo de vida del aprendizaje automático, con diferentes recursos utilizados durante las fases de I+D y producción.
La fase de I+D incluye:
- Sesiones de bloc de notas: experimentación de aprendizaje automático y entrenamiento de modelos
- Catálogo de modelos: control de versiones de modelos y gestión de modelos
- Despliegue de modelo: despliegue para servicio de modelo esclalable
La fase de producción incluye automatización de trabajos programados para pipelines de inferencia por lotes repetibles y automatización de la producción
Supervisión de OCI
OCI Monitoring proporciona visibilidad operativa centralizada en ambas plataformas para la supervisión, visualización y alertas relacionadas con el cambio de datos y el cambio de modelo. OCI Monitoring ayuda a garantizar la fiabilidad operativa y la preparación para la producción.
Interacción con la plataforma
La interacción entre la plataforma de Data Science y la plataforma de datos de IA sirve principalmente para los siguientes fines:
- La plataforma Data Science recupera los datos gestionados por la plataforma de datos de IA tanto para el entrenamiento de modelos (datos históricos) como para la automatización de la producción (nuevos casos que requieren puntuación).
- La plataforma Data Science enriquece los datos agregando puntuaciones de predicción para los casos recién procesados.
La capa de datos utilizada para la formación y la automatización de la producción puede variar entre aplicaciones, según el esquema y la arquitectura definidos por el ingeniero de datos. En muchos casos, los datos se obtienen de la capa de plata curada, pero también pueden provenir de las capas de bronce u oro, o de una combinación de varias capas.
Del mismo modo, los datos enriquecidos que contienen puntuaciones de predicción a menudo se escriben en la capa Gold, pero también se pueden almacenar en otras capas de datos, según los requisitos de la aplicación y la arquitectura de datos.
Los datos utilizados para la detección de cambios de datos pueden proceder de las capas Bronce, Plata u Oro, según el caso de uso específico y la arquitectura de datos.
Componentes de Arquitectura
- Oracle AI Data Platform
Oracle AI Data Platform es una plataforma unificada que simplifica la catalogación, preparación y análisis de datos en todo tu conjunto de datos. Reúne datos, inteligencia artificial, análisis y gobernanza dentro de una experiencia de usuario cohesiva que le permite crear aplicaciones seguras y escalables basadas en IA. Oracle AI Data Platform unifica Autonomous AI Lakehouse, Oracle Analytics Cloud, OCI Object Storage, OCI Generative AI y Fusion Data Intelligence.
En esta plataforma, Oracle AI Data Platform Workbench proporciona un entorno de desarrollo dedicado para que pueda diseñar, orquestar y desplegar pipelines y modelos de datos, definir políticas de RBAC y utilizar tecnologías de código abierto como Spark para preparar, analizar y enriquecer sus datos.
- Integración de datos de OCI
Oracle Cloud Infrastructure Data Integration es un servicio sin servidor y totalmente gestionado para diseñar y ejecutar pipelines de datos. Permite una extracción, transformación y carga perfectas de datos en destinos de OCI como Autonomous AI Lakehouse y OCI Object Storage. Los usuarios pueden crear flujos de integración a través de una interfaz intuitiva sin código que escala automáticamente los entornos de ejecución. Soporta ETL con procesamiento basado en Spark y ELT mediante SQL Pushdown para obtener rendimiento y eficiencia. El servicio también ofrece herramientas para la preparación de datos y protege contra el cambio de esquema con el manejo basado en reglas.
- Data Science
Oracle Cloud Infrastructure Data Science es una plataforma totalmente gestionada y sin servidor que los equipos de ciencia de datos pueden usar para construir, entrenar y gestionar modelos de aprendizaje automático (ML) en OCI. Se puede integrar fácilmente con otros servicios de OCI, como Oracle Autonomous AI Lakehouse, Oracle Cloud Infrastructure Object Storage y más. Puede crear y evaluar modelos de aprendizaje automático de alta calidad que aumenten la flexibilidad del negocio al poner los datos de confianza de la empresa a trabajar rápidamente, y puede respaldar los objetivos empresariales basados en datos con un despliegue más fácil de modelos de aprendizaje automático.
- OCI Identity and Access Management
Oracle Cloud Infrastructure Identity and Access Management (IAM) proporciona control de acceso de usuario para OCI y Oracle Cloud Applications. La API de IAM y la interfaz de usuario le permiten gestionar los dominios de identidad y los recursos que contienen. Cada dominio de identidad de OCI IAM representa una solución de gestión de identidad y acceso independiente o un grupo de usuarios diferente.
- Supervisión de OCI
Oracle Cloud Infrastructure Monitoring supervisa de forma activa y pasiva los recursos en la nube, y utiliza alarmas para notificarle cuando las métricas cumplen los disparadores especificados.
- OCI Object Storage
OCI Object Storage proporciona acceso a grandes cantidades de datos estructurados y no estructurados de cualquier tipo de contenido, incluidas copias de seguridad en bases de datos, datos analíticos y contenido enriquecido como imágenes y vídeos. Puede almacenar datos de forma segura directamente desde las aplicaciones o desde la plataforma en la nube. Puedes ampliar el almacenamiento sin experimentar ninguna degradación del rendimiento o la fiabilidad del servicio.
Utilice el almacenamiento estandar para el almacenamiento "caliente" al que debe acceder de forma rápida, inmediata y frecuente. Utilice este tipo de almacenamiento para el almacenamiento "frío" que conserva durante largos períodos de tiempo y a los a los que rara vez accede.
- Región OCI
Una región de OCI es un área geográfica localizada que contiene uno o más centros, denominados dominios de disponibilidad. Las regiones son independientes de otras regiones y pueden haber grandes distancias que las separan (entre países o incluso continentes).
- Gateway de servicio
Un gateway de servicios proporciona acceso desde una VCN a otros servicios, como Oracle Cloud Infrastructure Object Storage. El tráfico desde la VCN al servicio Oracle recorre el tejido de red de la Oracle y no atraviesa Internet.
- OCI Streaming
Oracle Cloud Infrastructure Streaming proporciona una solución duradera, escalable y totalmente gestionada para ingesta de flujos de datos continuos de elevado volumen a los que puede acceder y procesar en tiempo real. Puede utilizar OCI Streaming para ingerir datos de gran volumen, como registros de aplicación, telemetría operativa, datos de flujos de clics en el web o para otros casos en los que se producen y procesan datos de manera continua y secuencial en un modelo del envío de publicación-suscripción.
- Red virtual en la nube y subred de OCI
Una red virtual en la nube (VCN) es una red personalizable y definida por software que se configura en una región de OCI. Al igual que las Redes de los Centros de Datos Tradicionales, las Redes Virtuales le proporcionan control sobre su entorno de red. Una VCN puede tener varios bloques de enrutamiento entre dominios sin clases (CIDR) que puede cambiar después de crear la VCN. Puede segmentar una VCN en subredes, las cuales se pueden acotar a una región o a un dominio de disponibilidad. Cada subred está formada por un rango contiguo de direcciones que no se solapan con las demás subredes de la VCN. Puede cambiar el tamaño de una subred después de la creación. Una subred puede ser pública o privada.
Recomendaciones
Sus requisitos pueden ser diferentes.
- Automatice pipelines de inferencia repetibles mediante trabajos y programas de Data Science.
- Utilice las herramientas de despliegue y servicio de Data Science para admitir la ampliación, la supervisión operativa y la reproducibilidad.
- Controle las cargas de trabajo de Machine Learning de producción para comprobar el estado operativo, la modificación de datos y la modificación de modelos.
- Establezca una propiedad operativa clara entre los equipos de ingeniería de datos y ciencia de datos.
Consideraciones
- Implante políticas de OCI Identity and Access Management y control de acceso basado en roles (RBAC) en ambas plataformas.
- Controle las cargas de trabajo de producción para comprobar el estado operativo, el cambio de datos y el cambio de modelo.
- Utilice el almacenamiento regulado escalable para la retención y el análisis de datos a largo plazo.