Saltar al contenido principal
← Mapa de conocimiento

Biblioteca de conocimiento

Artículos

30 materiales prácticos en la base de conocimiento canónica.

Encontrados: 6 de 30
Evaluación de IAAvanzado · 7 min

Cómo evaluar browser agents: checklist práctica

Un protocolo de release reproducible para browser y computer-use agents: task state, visual grounding, trayectorias, side effects, recovery, seguridad y rollout limitado por riesgo.

cómo evaluar browser agentsevaluación de browser agentscomputer use agent eval
Leer →
Evaluación de IAPrincipal · 7 min

Benchmarks de agentes de IA: GAIA, WebArena, OSWorld y SWE-bench

Guía práctica para elegir un benchmark de agentes de IA: qué evalúan realmente GAIA, WebArena, OSWorld y SWE-bench, cómo interpretar sus resultados y trasladar la señal externa a un release gate propio.

benchmarks de agentes de IAbenchmark GAIAWebArena
Leer →
Evaluación de IAAvanzado · 6 min

Evaluación de trayectorias de agentes IA: comprobar el camino y el resultado

Guía práctica para evaluar trayectorias de agentes IA: contrato de trace, tool calls, permisos, reintentos, efectos, graders, fallos y release gate.

evaluación de trayectorias IAagent trace evaluationtrajectory grading
Leer →
Evaluación de IAAvanzado · 7 min

Cómo evaluar defensas contra prompt injection: checklist práctica

Un protocolo reproducible para probar defensas contra prompt injection: threat modeling, fixtures source-to-sink, tool traces, exfiltración de datos, side effects, falsos positivos, release gates y rollback.

evaluar defensas prompt injectionprompt injection evaluationprompt injection testing
Leer →
Evaluación de IAAvanzado · 6 min

Cómo evaluar el tool calling de IA: checklist práctica

Un protocolo reproducible para evaluar function calling y tool use: selección de herramientas, argumentos, trayectoria, side effects, retries, estado final, coste y release gate.

cómo evaluar AI tool callingtool calling evaluationfunction calling evals
Leer →
Evaluación de IAAvanzado · 7 min

Cómo evaluar alucinaciones de LLM: checklist práctica

Un protocolo reproducible para evaluar factuality y groundedness: tipos de afirmaciones, evidencia verificada, abstention, calibración, respuestas long-form, segmentos de riesgo y release gate.

cómo evaluar alucinaciones LLMevaluación de alucinaciones LLMfactuality evaluation
Leer →