Avanzadolisto7/10
Evaluación de IA
Conjuntos de datos de evaluación, métricas de calidad, evaluadores de modelos calibrados, pruebas de regresión, observabilidad y benchmarks.
6materiales
47min de lectura
2niveles
Inicio2
Núcleo2
Práctica2
Avanzado4
Ruta de aprendizaje
Ruta de estudio
Nivel principal
1Nivel avanzado
5- 01Cómo evaluar alucinaciones de LLM: checklist prácticaUn protocolo reproducible para evaluar factuality y groundedness: tipos de afirmaciones, evidencia verificada, abstention, calibración, respuestas long-form, segmentos de riesgo y release gate.Nivel avanzado8 min
- 02Cómo evaluar browser agents: checklist prácticaUn protocolo de release reproducible para browser y computer-use agents: task state, visual grounding, trayectorias, side effects, recovery, seguridad y rollout limitado por riesgo.Nivel avanzado8 min
- 03Cómo evaluar defensas contra prompt injection: checklist prácticaUn protocolo reproducible para probar defensas contra prompt injection: threat modeling, fixtures source-to-sink, tool traces, exfiltración de datos, side effects, falsos positivos, release gates y rollback.Nivel avanzado8 min
- 04Cómo evaluar el tool calling de IA: checklist prácticaUn protocolo reproducible para evaluar function calling y tool use: selección de herramientas, argumentos, trayectoria, side effects, retries, estado final, coste y release gate.Nivel avanzado7 min
- 05Evaluación de trayectorias de agentes IA: comprobar el camino y el resultadoGuía práctica para evaluar trayectorias de agentes IA: contrato de trace, tool calls, permisos, reintentos, efectos, graders, fallos y release gate.Nivel avanzado8 min