Перейти к основному содержимому
Продвинутыйготово7/10

Оценка ИИ

Наборы данных для оценки, метрики качества, калиброванные model graders, регрессионные тесты, наблюдаемость и бенчмарки.

6материалов
37мин чтения
2уровней
Старт2
Ядро2
Практика2
Продвинутый4
Начать с первого материала →

Учебный маршрут

Маршрут изучения

Открыть в каталоге →

Основной уровень

1
  1. 01Бенчмарки AI-агентов: GAIA, WebArena, OSWorld и SWE-benchПрактический guide по выбору benchmark для AI-агента: что действительно проверяют GAIA, WebArena, OSWorld и SWE-bench, как читать результаты и переносить внешний сигнал в собственный release gate.Основной уровень6 мин

Продвинутый уровень

5
  1. 01Как оценивать галлюцинации LLM: практический чек-листВоспроизводимый протокол оценки factuality и groundedness: типы утверждений, проверенные доказательства, abstention, калибровка, long-form ответы, сегменты риска и release gate.Продвинутый уровень6 мин
  2. 02Как оценивать защиту от prompt injection: практический чек-листВоспроизводимый протокол проверки защиты от prompt injection: threat model, source-to-sink fixtures, tool traces, утечка данных, side effects, false positives, release gates и rollback.Продвинутый уровень6 мин
  3. 03Как оценивать browser agents: практический чек-листВоспроизводимый release-протокол для browser и computer-use агентов: task state, visual grounding, траектории, side effects, recovery, безопасность и risk-bounded rollout.Продвинутый уровень7 мин
  4. 04Как оценивать tool calling AI-агента: практический чек-листВоспроизводимый протокол оценки function calling и tool use: выбор инструмента, аргументы, траектория, side effects, retries, финальное состояние, стоимость и release gate.Продвинутый уровень6 мин
  5. 05Trajectory evaluation AI-агентов: проверять путь, а не только результатПрактический guide по оценке траекторий AI-агента: trace contract, tool calls, permissions, retries, side effects, graders, taxonomy и release gate.Продвинутый уровень6 мин