Перейти к основному содержимому
← Карта знаний

Библиотека знаний

Статьи

30 практических материалов в канонической базе знаний.

Найдено: 6 из 30
Оценка ИИПродвинутый · 7 мин

Как оценивать browser agents: практический чек-лист

Воспроизводимый release-протокол для browser и computer-use агентов: task state, visual grounding, траектории, side effects, recovery, безопасность и risk-bounded rollout.

как оценивать browser agentsbrowser agent evaluationcomputer use agent eval
Читать →
Оценка ИИОсновной · 7 мин

Бенчмарки AI-агентов: GAIA, WebArena, OSWorld и SWE-bench

Практический guide по выбору benchmark для AI-агента: что действительно проверяют GAIA, WebArena, OSWorld и SWE-bench, как читать результаты и переносить внешний сигнал в собственный release gate.

бенчмарки AI-агентовGAIA benchmarkWebArena
Читать →
Оценка ИИПродвинутый · 6 мин

Trajectory evaluation AI-агентов: проверять путь, а не только результат

Практический guide по оценке траекторий AI-агента: trace contract, tool calls, permissions, retries, side effects, graders, taxonomy и release gate.

trajectory evaluation AI-агентовagent trace evaluationtrajectory grading
Читать →
Оценка ИИПродвинутый · 7 мин

Как оценивать защиту от prompt injection: практический чек-лист

Воспроизводимый протокол проверки защиты от prompt injection: threat model, source-to-sink fixtures, tool traces, утечка данных, side effects, false positives, release gates и rollback.

оценка защиты prompt injectionprompt injection evaluationprompt injection testing
Читать →
Оценка ИИПродвинутый · 6 мин

Как оценивать tool calling AI-агента: практический чек-лист

Воспроизводимый протокол оценки function calling и tool use: выбор инструмента, аргументы, траектория, side effects, retries, финальное состояние, стоимость и release gate.

как оценивать AI tool callingtool calling evaluationfunction calling evals
Читать →
Оценка ИИПродвинутый · 7 мин

Как оценивать галлюцинации LLM: практический чек-лист

Воспроизводимый протокол оценки factuality и groundedness: типы утверждений, проверенные доказательства, abstention, калибровка, long-form ответы, сегменты риска и release gate.

как оценивать галлюцинации LLMLLM hallucination evaluationfactuality evaluation
Читать →