Saltar al contenido principal

Curso completo

Ingeniero de IA

De los fundamentos de programación a sistemas de IA en producción

Ruta progresiva de habilidades para ingenieros que construyen productos prácticos con modelos fundacionales, RAG, agentes, evaluación e infraestructura de producción.

No te limites a completar los materiales. Construye un portafolio de artefactos listos para producción: un cliente API fiable, RAG basado en evidencia, un agente gobernado, un gate de evaluación y un sistema de IA final con controles de runtime.

0%0/33 lecciones

El progreso se guarda localmente en tu navegador.

6–12 meses6 módulos33 lecciones4 evaluaciones

Sistema operativo de estudio

Cómo completar el curso y conservar un resultado real

1. Entender el concepto

Lee el material principal y explica con tus propias palabras qué resuelve, dónde falla y qué compromisos introduce.

2. Reproducirlo con las manos

No avances después de una sola lectura. Construye un artefacto mínimo funcional: código, diagrama, conjunto de evals, política o workflow observable.

3. Romper tu propia solución

Añade al menos un caso de fallo: timeout, contexto obsoleto, prompt injection, esquema inválido, llamada de tool incorrecta o exceso de presupuesto.

4. Registrar evidencia

Guarda resultados de tests, captura o trace, resultado de aceptación o un postmortem breve. Se evalúa la prueba de funcionamiento, no el número de páginas abiertas.

Reglas del curso

No basta con leer: hay que demostrarlo

  • No des una lección por terminada solo por leerla; hace falta artefacto o evidencia.
  • Si un prerrequisito es débil, vuelve atrás. El curso es un grafo de dependencias, no una playlist.
  • No optimices coste antes de una baseline de calidad ni aumentes autonomía antes de evaluación y controles.
  • Cierra cada proyecto o milestone con un postmortem breve: qué falló, qué cambió y qué señal monitorizas ahora.

Módulo 1

Fundamentos de ingeniería

La base necesaria para que los productos de IA no se conviertan en demos frágiles.

ResultadoUn proyecto Python/API fiable con tipado, pruebas y gestión controlada de errores.
  1. Python para producción

    Principal

    Tipado, entornos virtuales, packaging, async, logging y testing.

  2. Tipado y contratos de datos

    Principal

    Tipos, dataclasses, Pydantic y validación de esquemas.

  3. Async y clientes API

    Principal

    Concurrencia, timeouts, reintentos y límites de tasa.

  4. Patrones de fiabilidad

    Recomendado

    Idempotencia, backoff, circuit breakers y observabilidad.

  5. HTTP, APIs y fundamentos backend

    Principal

    REST, streaming, autenticación, colas y trabajos en segundo plano.

    Prerrequisitos: Python para producción

  6. Proyecto: cliente API de IA resiliente

    Proyectopráctica + evaluación

    Cliente con salidas estructuradas, reintentos, timeouts, tracing y pruebas.

    Prerrequisitos: Python para producción, HTTP, APIs y fundamentos backend

Checkpoint después del módulo

Baseline de ingeniería

  • ✓ el cliente API supera los tests
  • ✓ hay retries, timeouts e idempotencia
  • ✓ los errores tienen tipos controlados y logs

Módulo 2

Núcleo de ingeniería LLM

Cómo funcionan los modelos dentro de un sistema aplicado y cómo controlar su comportamiento.

ResultadoUn workflow LLM controlado con salidas estructuradas, gestión de contexto y routing de modelos.
  1. LLM, tokens, contexto e inferencia

    Principal

    Fundamentos de transformers, tokenización, ventanas de contexto, latencia y coste.

  2. Ingeniería de prompts y contexto

    Principal

    Instrucciones de sistema, ejemplos, restricciones, context packing y modos de fallo.

    Prerrequisitos: LLM, tokens, contexto e inferencia

  3. Salidas estructuradas y tool calling

    Principal

    JSON Schema, validación, contratos de funciones y ejecución segura de herramientas.

    Prerrequisitos: Ingeniería de prompts y contexto

  4. Selección y routing de modelos

    Recomendado

    Calidad, coste, latencia, fallbacks y estrategia multi-modelo.

    Prerrequisitos: LLM, tokens, contexto e inferencia

Checkpoint después del módulo

Workflow LLM controlado

  • ✓ la salida estructurada se valida contra un esquema
  • ✓ los contratos de tools tienen límites explícitos
  • ✓ existe una decisión de modelo y fallback

Módulo 3

RAG y sistemas de conocimiento

Construcción de sistemas que responden a partir de datos propios y evidencia verificable.

ResultadoRAG listo para producción con citas, evaluación, frescura y control de acceso.
  1. Embeddings y búsqueda semántica

    Principal

    Representaciones vectoriales, similitud e indexación.

  2. Ingesta y chunking

    Principal

    Parsing, metadatos, estrategias de chunks y calidad documental.

    Prerrequisitos: Embeddings y búsqueda semántica

  3. Retrieval, búsqueda híbrida y reranking

    Principal

    Reescritura de consultas, multi-query, filtros y rerankers.

    Prerrequisitos: Ingesta y chunking

  4. Citas, frescura, ACL y observabilidad

    Principal

    Evidencia, hechos versionados, permisos, traces y evaluaciones.

    Prerrequisitos: Retrieval, búsqueda híbrida y reranking

  5. Proyecto: asistente de conocimiento basado en evidencia

    Proyectopráctica + evaluación

    Asistente con citas, ACL, evaluaciones de regresión y política de frescura.

    Prerrequisitos: Citas, frescura, ACL y observabilidad

Checkpoint después del módulo

Sistema de conocimiento evidence-first

  • ✓ las respuestas incluyen citas
  • ✓ se verifican ACL y frescura
  • ✓ existen casos de regresión de retrieval

Módulo 4

Agentes y ecosistemas de herramientas

Sistemas gobernados de múltiples pasos con herramientas, estado y supervisión humana.

ResultadoUn agente con estado explícito, límites de permisos, auditoría y evaluación.
  1. Agent loop y planificación

    Principal

    Objetivo, plan, acción, observación y condiciones de parada.

  2. Estado y memoria

    Principal

    Estado de trabajo, historial, conocimiento duradero y límites de contexto.

    Prerrequisitos: Agent loop y planificación

  3. Máquinas de estado, handoffs y multi-agente

    Recomendado

    Flujo de control determinista, delegación y coordinación.

    Prerrequisitos: Estado y memoria

  4. Servidores MCP, clientes y autorización

    Principal

    Integración estandarizada de herramientas/datos y contratos seguros.

    Prerrequisitos: Agent loop y planificación

  5. Proyecto: agente de operaciones gobernado

    Proyectopráctica + evaluación

    Agente con aprobaciones, límites de coste/tiempo, herramientas, auditoría y rollback.

    Prerrequisitos: Máquinas de estado, handoffs y multi-agente, Servidores MCP, clientes y autorización

Checkpoint después del módulo

Agente gobernado

  • ✓ estado y condiciones de parada son explícitos
  • ✓ acciones de alto impacto tienen un límite de aprobación
  • ✓ acciones de tools tienen audit trail

Módulo 5

Evaluación, seguridad y calidad

Verificación sistemática de calidad, seguridad y regresiones.

ResultadoPipeline de evaluación que bloquea releases inseguros o débiles.
  1. Datasets de evaluación y casos de prueba

    Principal

    Casos representativos, golden sets y feedback de producción.

  2. Métricas y model graders

    Principal

    Checks deterministas, LLM judges, calibración y sesgo.

    Prerrequisitos: Datasets de evaluación y casos de prueba

  3. Prompt injection, guardrails y red teaming

    Principal

    Modelos de amenaza, aislamiento de herramientas, fuga de datos y pruebas adversariales.

  4. Gates de regresión y release

    Hitopráctica + evaluación

    Umbrales, baselines, integración CI y criterios de rollback.

    Prerrequisitos: Métricas y model graders, Prompt injection, guardrails y red teaming

Checkpoint después del módulo

Gate de calidad de release

  • ✓ existe un dataset de eval representativo
  • ✓ los umbrales de calidad están definidos
  • ✓ una regresión peligrosa bloquea el release

Módulo 6

Sistemas de IA en producción y operaciones de runtime

Despliegue, serving, observabilidad, evidencia de runtime, control de cambios de modelo/proveedor, coste, fiabilidad y respuesta a incidentes.

ResultadoUn sistema de IA con SLO, runtime truth trazable, cambios de modelo/proveedor gobernados, rollback a una configuración conocida como válida y economía verificada.
  1. Serving, streaming y batching

    Principal

    APIs gestionadas, self-hosting, vLLM, colas, backpressure, cuotas y límites de capacidad.

  2. Tracing, SLO y monitorización de producción

    Principal

    Trazas end-to-end a través de llamadas a modelos, retrieval y herramientas, además de latencia, coste, calidad, errores, drift y alertas.

    Prerrequisitos: Serving, streaming y batching

  3. Evidencia de runtime y prevención de false-green

    Principal

    Registro del fingerprint del commit/config desplegado, postcondiciones autoritativas, verificación en producción y verdades separadas para CI, despliegue e indexación.

    Prerrequisitos: Tracing, SLO y monitorización de producción

  4. Control de cambios de modelo, prompt, retrieval y proveedor

    Principal

    Release envelope versionado para revisión de modelo, prompt, retrieval/index, herramientas, política y proveedor; replay, canary, holdback y rollback como un único contrato de cambio.

    Prerrequisitos: Evidencia de runtime y prevención de false-green, Gates de regresión y release

  5. Presupuestos de capacidad, coste y routing

    Recomendado

    Concurrencia, rate limits, presupuestos de tokens/herramientas, coste por tarea verificada correctamente y economía de fallback entre modelos o proveedores.

    Prerrequisitos: Serving, streaming y batching

  6. Privacidad, secretos y gobernanza

    Principal

    PII, políticas de datos, supply chain, sandboxing, policy engines y acceso a herramientas con autoridad mínima.

  7. Inyección de fallos, failover y reconciliación

    Recomendado

    Pruebas de 429/5xx, timeout, caída del proveedor, efectos parciales y entrega duplicada; primero reconciliar, después reintentar; verificar el fallback antes de un incidente real.

    Prerrequisitos: Evidencia de runtime y prevención de false-green, Control de cambios de modelo, prompt, retrieval y proveedor

  8. Respuesta a incidentes y rollback

    Recomendado

    Runbooks, kill switches acotados, fallback de modelo/proveedor, recuperación a una configuración known-good y postmortem → prueba de regresión permanente.

    Prerrequisitos: Inyección de fallos, failover y reconciliación

  9. Capstone: sistema de IA en producción

    Hito

    Sistema end-to-end con contratos, RAG/agentes, evals, release envelope versionado, deployment gates, evidencia de runtime, simulacros de fallos y recuperación verificada.

    Prerrequisitos: Respuesta a incidentes y rollback, Privacidad, secretos y gobernanza, Presupuestos de capacidad, coste y routing

Checkpoint después del módulo

Preparación para producción

  • ✓ existen SLO y monitoring
  • ✓ rollback o kill switch está probado
  • ✓ se miden coste y modos de fallo

Contrato capstone

Capstone: sistema de IA en producción

Construye un sistema end-to-end donde el LLM sea solo un componente. Debe recibir input real, trabajar con conocimiento o tools, superar evals, ofrecer observabilidad y comportarse de forma controlada ante fallos.

Qué entregar

  • — diagrama de arquitectura y ADR breve con los trade-offs principales
  • — repositorio o prototipo ejecutable con README y setup
  • — dataset de evaluación y resultados de baseline y regresión
  • — evidencia de observabilidad: traces, latencia, errores y coste
  • — modelo de seguridad y autoridad para datos y acciones de tools
  • — runbook de fallos, rollback, kill switch y recuperación

Cuándo puede considerarse terminado

  • ✓ el happy path funciona desde input hasta output verificado
  • ✓ al menos tres escenarios de fallo se reproducen y gestionan de forma predecible
  • ✓ una acción crítica no se ejecuta fuera del límite de autoridad definido
  • ✓ el release puede detenerse o revertirse sin caos manual
  • ✓ otro ingeniero puede entender el resultado mediante evidencia y no mediante “parece que funciona”

Práctica final y evaluación

El curso termina con un artefacto práctico y una rúbrica de aceptación. El resultado se considera completo después de cumplir los criterios de aceptación, no solo de leer los materiales.