Saltar al contenido principal
Avanzadolisto7/10

Evaluación de IA

Conjuntos de datos de evaluación, métricas de calidad, evaluadores de modelos calibrados, pruebas de regresión, observabilidad y benchmarks.

6materiales
47min de lectura
2niveles
Inicio2
Núcleo2
Práctica2
Avanzado4
Empezar con el primer material →

Ruta de aprendizaje

Ruta de estudio

Abrir en el catálogo →

Nivel principal

1
  1. 01Benchmarks de agentes de IA: GAIA, WebArena, OSWorld y SWE-benchGuía práctica para elegir un benchmark de agentes de IA: qué evalúan realmente GAIA, WebArena, OSWorld y SWE-bench, cómo interpretar sus resultados y trasladar la señal externa a un release gate propio.Nivel principal8 min

Nivel avanzado

5
  1. 01Cómo evaluar alucinaciones de LLM: checklist prácticaUn protocolo reproducible para evaluar factuality y groundedness: tipos de afirmaciones, evidencia verificada, abstention, calibración, respuestas long-form, segmentos de riesgo y release gate.Nivel avanzado8 min
  2. 02Cómo evaluar browser agents: checklist prácticaUn protocolo de release reproducible para browser y computer-use agents: task state, visual grounding, trayectorias, side effects, recovery, seguridad y rollout limitado por riesgo.Nivel avanzado8 min
  3. 03Cómo evaluar defensas contra prompt injection: checklist prácticaUn protocolo reproducible para probar defensas contra prompt injection: threat modeling, fixtures source-to-sink, tool traces, exfiltración de datos, side effects, falsos positivos, release gates y rollback.Nivel avanzado8 min
  4. 04Cómo evaluar el tool calling de IA: checklist prácticaUn protocolo reproducible para evaluar function calling y tool use: selección de herramientas, argumentos, trayectoria, side effects, retries, estado final, coste y release gate.Nivel avanzado7 min
  5. 05Evaluación de trayectorias de agentes IA: comprobar el camino y el resultadoGuía práctica para evaluar trayectorias de agentes IA: contrato de trace, tool calls, permisos, reintentos, efectos, graders, fallos y release gate.Nivel avanzado8 min