Продвинутыйготово7/10
Оценка ИИ
Наборы данных для оценки, метрики качества, калиброванные model graders, регрессионные тесты, наблюдаемость и бенчмарки.
6материалов
37мин чтения
2уровней
Старт2
Ядро2
Практика2
Продвинутый4
Учебный маршрут
Маршрут изучения
Основной уровень
1Продвинутый уровень
5- 01Как оценивать галлюцинации LLM: практический чек-листВоспроизводимый протокол оценки factuality и groundedness: типы утверждений, проверенные доказательства, abstention, калибровка, long-form ответы, сегменты риска и release gate.Продвинутый уровень6 мин
- 02Как оценивать защиту от prompt injection: практический чек-листВоспроизводимый протокол проверки защиты от prompt injection: threat model, source-to-sink fixtures, tool traces, утечка данных, side effects, false positives, release gates и rollback.Продвинутый уровень6 мин
- 03Как оценивать browser agents: практический чек-листВоспроизводимый release-протокол для browser и computer-use агентов: task state, visual grounding, траектории, side effects, recovery, безопасность и risk-bounded rollout.Продвинутый уровень7 мин
- 04Как оценивать tool calling AI-агента: практический чек-листВоспроизводимый протокол оценки function calling и tool use: выбор инструмента, аргументы, траектория, side effects, retries, финальное состояние, стоимость и release gate.Продвинутый уровень6 мин
- 05Trajectory evaluation AI-агентов: проверять путь, а не только результатПрактический guide по оценке траекторий AI-агента: trace contract, tool calls, permissions, retries, side effects, graders, taxonomy и release gate.Продвинутый уровень6 мин