Una arquitectura de machine learning es el esquema que ordena los datos, el entrenamiento, los servicios y el monitoreo de un proyecto de inteligencia artificial. Definirla bien no es solo una cuestión técnica: es una decisión estratégica que impacta en los costos, la confiabilidad y la velocidad con la que la IA genera valor para el negocio.

En esta nota proponemos un modelo de referencia en cuatro capas, explicado con una metáfora simple, y compartimos las preguntas que todo CTO debería hacerse antes de escalar sus proyectos.

Puntos clave:

  • Una arquitectura de machine learning abarca el hardware y el software necesarios para desarrollar, entrenar, desplegar y operar modelos.
  • Las cuatro capas de referencia son: datos, entrenamiento, servicios e instrumentación.
  • La capa de entrenamiento es temporal y elástica; la de servicios es permanente y exige disponibilidad 24/7.
  • La instrumentación atraviesa todas las capas e incluye DevOps, SecOps y MLOps.

Qué es una arquitectura de machine learning

Una arquitectura de machine learning es el conjunto organizado de componentes de datos, cómputo, software y operación que permite llevar un modelo desde el experimento hasta producción. Define qué piezas existen, cómo se comunican y quién es responsable de cada una.

El machine learning es la técnica de entrenar una computadora para encontrar patrones, hacer predicciones y aprender de la experiencia sin programación explícita. Sin una arquitectura clara, esos modelos se quedan en pruebas de concepto que nunca llegan a operar.

Por qué tantas empresas no tienen una arquitectura de machine learning clara

Cada vez usamos más IA en la tecnología que desplegamos en la empresa. Sin embargo, dentro de las mismas organizaciones suele haber confusión: se usan nombres distintos para los mismos conceptos y no existe un esquema de referencia compartido.

A eso se suma que la IA empresarial todavía está madurando: hay muchas pruebas de concepto y pocos casos de uso reales en producción. Y está el ruido comercial de quienes venden «la mejor tecnología» sin entender antes qué flujos de trabajo necesita cada empresa.

Por eso la pregunta clave para un CTO es: ¿qué arquitectura de referencia necesitamos para construir flujos de trabajo flexibles, pero a la vez confiables? Y, sobre todo, ¿cómo la explicamos para que el negocio la entienda?

La metáfora de la cocina

Las arquitecturas tecnológicas suelen describirse en capas: una encima de otra, donde cada nivel habla con el de arriba o el de abajo. La idea viene de la ingeniería y es útil, pero no siempre aplica.

Pensemos en una cocina. Tiene heladera, horno, microondas, lavavajillas y licuadora. Cada artefacto resuelve un problema propio y casi ninguno se comunica con otro. Es difícil hablar de «capas» en ese caso.

Lo mismo pasa con muchos componentes de software y hardware: cada uno resuelve algo muy específico. Aun así, abstraer en capas ayuda a ordenar la conversación, siempre que la tomemos como un esquema flexible y adaptable.

Las 4 capas de una arquitectura de machine learning

Como las infraestructuras de IA suelen ser complejas, proponemos organizarlas en cuatro capas. Cada una tiene reglas, riesgos y responsables distintos:

  1. Capa de datos.
    Es la base. Incluye archivos, imágenes, bases de datos y todos los procesos de ingesta y transformación, conocidos como pipelines o ETL. Sobre ella se apoya una subcapa analítica, donde por ejemplo una consulta SQL ya permite extraer insights para un reporte.
  2. Capa de entrenamiento.
    Es una capa bajo demanda y temporal: una vez entrenado el modelo, las máquinas se apagan. Puede requerir GPU o cómputo de alto rendimiento (HPC) durante horas. Acá viven los datasets etiquetados y los scripts de entrenamiento del equipo de data science.
  3. Capa de servicios.
    Es permanente y no puede caerse. Requiere soporte 24/7, políticas de seguridad y gobierno, y definiciones sobre APIs, accesos y permisos. A diferencia del «laboratorio» de entrenamiento, acá las reglas deben ser estrictas.
  4. Capa de instrumentación.
    Es transversal y orquesta todo lo demás. Monitorea si un entrenamiento salió bien, qué consumo tiene una API y quién la usa. Incluye DevOps, SecOps y MLOps, el control del código en Git y la gestión de contenedores con Docker.

Un ejemplo de instrumentación en la arquitectura de machine learning

¿Por qué tener un repositorio local de imágenes Docker? Porque construir un componente de servicio en 20 minutos no es lo mismo que hacerlo en 20 segundos.

Si el repositorio está cerca de la nube donde se despliegan los componentes, cada build es mucho más rápido. Son decisiones pequeñas que, multiplicadas por decenas de servicios, cambian la productividad del equipo.

Del programa único a cientos de servicios

Antes alcanzaba con ejecutar un programa en un único servidor. Hoy un CTO puede tener varios proyectos, cada uno en contenedores, con infraestructura elástica donde los servicios se crean y destruyen según la demanda.

Volvamos a la cocina. Con un solo artefacto no nos importa el manual ni la garantía. Con diez, guardamos todos los manuales en una carpeta, tenemos un técnico de confianza y quizás compramos todo de la misma marca.

Orquestar una arquitectura de machine learning es exactamente eso: poner orden cuando los componentes se multiplican. Con 25 servicios, centralizar logs, costos y código deja de ser opcional.
— Equipo de Data Engineering, 7Puentes

Hay que saber qué máquinas están encendidas, cuánto cuestan y dónde está cada pieza de código: pipelines, scripts de entrenamiento, APIs y dashboards. Todo eso vive en repositorios Git que deben mantenerse actualizados y con control de calidad. Cuando se pasa de unos pocos proyectos a 40 o 50, cada uno con su repositorio, la centralización es indispensable.

Cómo diseñar la arquitectura de machine learning de tu empresa

No existe una arquitectura universal. Recomendamos empezar por estas preguntas:

  1. ¿Qué casos de uso vamos a llevar a producción?
    Un sistema de detección de anomalías con IA no tiene los mismos requisitos que un modelo de pronóstico de demanda.
  2. ¿Qué capas ya tenemos y cuáles faltan?
    Muchas empresas tienen datos pero no instrumentación, o modelos entrenados sin una capa de servicios confiable.
  3. ¿Cómo controlamos costos y accesos?
    La elasticidad ahorra dinero solo si alguien vigila qué se enciende y qué se apaga.
  4. ¿Quién se ocupa de cada capa?
    Un equipo como nuestro Agile Data Squad puede cubrir datos, modelos y operación de forma integrada.

Si querés validar una idea rápido, un MVP de IA permite probar la arquitectura a pequeña escala antes de invertir fuerte. También te puede interesar nuestra nota sobre cómo acelerar proyectos de IA.

7Puentes: tu aliado para la infraestructura de IA

En 7Puentes ayudamos a las áreas de tecnología a definir políticas para ordenar, planificar y escalar su arquitectura de machine learning. El objetivo es que los proyectos sean más eficientes, cuesten menos y rindan más. Conocé nuestro servicio de consultoría en IA.

Preguntas frecuentes

¿Qué es una arquitectura de machine learning?

Es el conjunto organizado de componentes de datos, cómputo, software y operación que permite llevar un modelo de machine learning desde el experimento hasta producción. Define qué piezas existen, cómo se comunican y quién es responsable de cada una.

¿Cuáles son las capas de una arquitectura de machine learning?

Un modelo de referencia útil tiene cuatro capas: datos, entrenamiento, servicios e instrumentación. La instrumentación es transversal y monitorea a las otras tres.

¿Qué diferencia hay entre la capa de entrenamiento y la de servicios?

La capa de entrenamiento es temporal y elástica: se enciende para entrenar el modelo y luego se apaga. La capa de servicios es permanente, debe estar disponible las 24 horas y tiene reglas estrictas de seguridad y acceso.

¿Qué es MLOps y dónde encaja en la arquitectura?

MLOps es el conjunto de prácticas para desplegar, monitorear y mantener modelos de machine learning en producción. En el modelo de cuatro capas forma parte de la capa de instrumentación, junto con DevOps y SecOps.

¿Querés ordenar la infraestructura de tus proyectos de IA? Contanos tu caso.
Contact