Перейти к основному содержимому
Продвинутый16–24 часа

Управляемый операционный AI-агент

Постройте управляемого AI-агента с tools, явным состоянием, approvals, ограничениями стоимости и времени, audit log и rollback path.

agent statetool contractsMCPавторизацияhuman approvalauditability

Сценарий

Задача

Агент готовит изменения в операционной среде: читает данные, формирует план, вызывает tools и запрашивает approval перед рискованными действиями. Любое действие должно восстанавливаться по audit trail.

Пошаговое выполнение

1. Спроектируйте state machine

Результат: Поведение агента не зависит от скрытого цикла.

Задачи

  • Опишите states
  • Определите transitions
  • Добавьте max steps
  • Добавьте terminal outcomes

Проверки

  • У каждого state есть exit condition
  • Infinite loop невозможен

2. Введите tool governance

Результат: Каждый tool имеет контракт и явные границы доступа.

Задачи

  • Опишите input/output schema
  • Назначьте risk level
  • Установите permission scope
  • Добавьте dry-run

Проверки

  • Неизвестные tools блокируются
  • Write tool не запускается без применимой policy

3. Добавьте approvals и budgets

Результат: Риск, время и стоимость ограничены до выполнения.

Задачи

  • Определите approval gates
  • Добавьте token/cost budget
  • Добавьте timeout
  • Добавьте cancellation

Проверки

  • Высокий риск всегда ждёт approval
  • Исчерпание budget безопасно завершает цикл

4. Проверьте auditability и rollback

Результат: Действие можно объяснить, воспроизвести или откатить.

Задачи

  • Логируйте decision inputs
  • Сохраняйте tool results
  • Добавьте rollback handler
  • Проведите failure drill

Проверки

  • Audit log восстанавливает последовательность
  • Rollback имеет evidence

Критерии приёмки

  • Есть deterministic state machine
  • У каждого tool есть risk и permission policy
  • Write actions требуют approval
  • У агента есть time/cost/step limits
  • Failure drill и rollback пройдены

Рубрика оценки

Как оценивается результат

Проходной балл: 75/100 · Отличие: 92/100

State machine и stop conditions

States, transitions, terminal outcomes и recovery описаны явно.

25 баллов

Недостаточно

Поведение зависит от скрытого или неограниченного loop.

Компетентно

У каждого state есть exit condition и явные limits.

Сильно

Реализованы deterministic replay, recovery states и property tests.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ State diagram или transition table

Tool governance

Каждый tool имеет schema, permission scope, risk level и dry-run policy.

25 баллов

Недостаточно

Tools вызываются без явных контрактов или границ доступа.

Компетентно

Registry определяет contracts, risks и permissions.

Сильно

Policies исполняются отдельным policy engine и покрыты тестами.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Tool registry

Approvals и budgets

Рискованные действия, время, шаги и стоимость ограничены до выполнения.

25 баллов

Недостаточно

Write actions могут выполняться без approval или limits.

Компетентно

Approval gates и budgets блокируют опасные действия.

Сильно

Реализованы risk-based policy, cancellation и delegated approvals.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Пример approval request и budget exhaustion

Auditability и rollback

Последовательность решений воспроизводима, а изменения имеют rollback evidence.

25 баллов

Недостаточно

Audit trail неполный или rollback только декларативный.

Компетентно

Audit log восстанавливает цикл, rollback проверен.

Сильно

Реализованы tamper-evident log, replay и автоматизированный recovery drill.

Необходимые доказательства

  • ✓ Ссылка на код или артефакт
  • ✓ Короткий README с решениями
  • ✓ Вывод тестов или runtime evidence
  • ✓ Failure drill и rollback report