Перейти до основного вмісту
Просунутий7 хв1154 слівСкладність 5/5Автоматизація A4

Як Alberta запустила ~50 Claude Code агентів і просканувала 466 млн рядків government code

Production-кейс Government of Alberta + Claude Code: паралельний security scan 3,400 repositories, cited findings, generated fixes/tests, human-approved patches і continuous red/blue agent review — з government-grade authority та audit boundaries.

Картка кейсу

Що тут автоматизовано

Складність 5/5Автоматизація A4

Обсяг автоматизації

Government of Alberta використав Claude Code/Agent SDK для масштабного аналізу legacy government code: приблизно 50 агентів паралельно сканували repositories, rules engine знаходив patterns, Claude переглядав findings і cites exact file/line, а для частини vulnerabilities генерував fix, tests і build. AI-Magister відтворює це як bounded security-modernization factory з read-first scanning, evidence-backed remediation candidates та human release authority.

Роль людини

Ministry engineers і cybersecurity teams визначають scan scope, rules/security controls, validate findings, review generated fixes/tests та approve patches до shipping. Program owners вирішують modernization scope і application consolidation; agent recommendations не замінюють procurement, privacy, risk acceptance або production change authority.

Заявлені результати

  • 466 million lines of government code assessed in about 20 hours — Anthropic and Government of Alberta reported
  • Around 50 agents worked autonomously and in parallel during the scan — Anthropic-reported implementation detail
  • Ministry footprint: roughly 1,280 applications and 3,400 code repositories across all 27 provincial ministries — official government/provider context
  • Anthropic reports the team estimated a comparable traditional review at around 6.5 years — estimate, not audited baseline
  • Government of Alberta targets up to 95% reduction in modernization time and cost and cites up to 20x demonstrated speed potential — official government target/claim, not an independent realized portfolio-wide outcome

Anthropic і Government of Alberta 6 липня 2026 року повідомили, що близько 50 agents autonomous/parallel просканували 466 млн lines of code приблизно за 20 годин; Ministry охоплює ~1,280 applications і 3,400 code repositories across 27 ministries. Anthropic каже, що команда оцінює equivalent traditional review у ~6.5 років; Alberta повідомляє broader modernization targets до 95% time/cost reduction. Це government/provider-reported estimates/targets, не незалежний benchmark.

Зміст статті
  1. 01Бізнес-задача: security debt масштабується швидше, ніж ручний review
  2. 02Trigger, input, AI stage, integrations та output
  3. 03Чому two-stage scan сильніший за 'LLM, знайди vulnerability'
  4. 04Autonomy A4 і parallelism ~50 agents
  5. 05Continuous red/blue review та 95 security controls
  6. 06Government data, authority та audit boundary
  7. 07Failure modes, reconciliation та recovery
  8. 08Economics і як не збрехати самим собі цифрою '6.5 years → 20 hours'
  9. 09Staged rollout і як повторити

Передумови

Бізнес-задача: security debt масштабується швидше, ніж ручний review

Ministry of Technology and Innovation підтримує системи всіх 27 provincial ministries: social services, public safety, wildfire response та інші critical services. Портфель із приблизно 1,280 applications і 3,400 repositories накопичує legacy dependencies, undocumented code і vulnerabilities швидше, ніж невелика security team може це перевірити вручну.

Alberta побудувала паралельну agentic review factory. Важливий момент: agent не отримав право 'виправити весь уряд'. Scan і remediation були розкладені на evidence-producing stages, а patch до production проходив engineer review/approval. Це хороший government pattern: AI масштабує analysis/execution, але accountability не зникає.

architecture

Карта системи: Як Alberta запустила ~50 Claude Code агентів і просканувала 466 млн рядків government code

Схема побудована з ключових секцій статті та показує послідовність або архітектурні блоки, які потрібно опрацювати.

Trigger, input, AI stage, integrations та output

Trigger — portfolio scan, repository change, modernization batch або security review в SDLC. Input — repository snapshot/SHA, rules engine configuration, security-control baseline, build/test environment, documentation і ownership metadata. Sensitive operational secrets не повинні входити в model context без окремої eligibility.

AI stage двоступеневий: deterministic/rules scan flags known patterns; Claude переглядає findings, reasons about context і cites exact file/line. Для remediation Claude може generate patch, tests і build candidate. Output — evidence-backed finding/remediation artifact із repository/version identity, severity, source location, checks та human decision.

  • Trigger → portfolio/repo/security event.
  • Input → versioned repo + rule set + control baseline + build/test sandbox.
  • AI → parallel scan → contextual review → cited finding → candidate fix/tests.
  • HITL → engineer validates finding and patch.
  • Output → approved PR/change + authoritative CI/runtime evidence.

timeline

Контрольні точки для практичного застосування

Візуалізація використовує тези, приклади та наступні кроки статті як перевірювані контрольні точки, а не декоративні елементи.

Чому two-stage scan сильніший за 'LLM, знайди vulnerability'

Rules engine забезпечує deterministic recall для відомих patterns і відтворюваність. Claude додає contextual reasoning: чи finding справді exploitable/meaningful у конкретному code path, який exact file/line його підтримує, що треба виправити. Такий split знижує ризик, що language model стане єдиним oracle.

Для відтворення findings повинні мати provenance: scanner version, model revision, repo SHA, rule/control ID, exact evidence, confidence/severity та disposition. False positive, accepted risk і fixed finding не можна змішувати. Re-scan після fix має підтвердити postcondition на fresh source.

Autonomy A4 і parallelism ~50 agents

Паралельність дає різкий throughput, але multiplicative blast radius. A4 допустимий для read-only scan і isolated build/test; небезпечний для unrestricted production writes. Concurrency manager має лімітувати repositories, tokens/compute, network, tool scopes та duplicated work і зберігати deterministic task IDs.

Agent може сам generate fix і tests, але patch shipping має independent gate. Якщо application не має tests, agent може створити їх, проте generated test не є доказом correct business behavior сам по собі. Legacy modernization потребує domain owner acceptance, integration tests і staged rollout.

Continuous red/blue review та 95 security controls

Anthropic описує specialized red-team agent, що probes application і maps exploit path, та blue-team agent, що оцінює defenses і формує remediation plan. Кожна application перевіряється приблизно проти 95 security controls. Це корисний multi-agent split: attacker і defender мають різні objectives, а результат сходиться у verifiable evidence.

Control set повинен бути versioned. Зміна standard/control mapping автоматично інвалідовує старе 'pass' там, де scope змінився. Critical control failure блокує release незалежно від aggregate score. AI-generated security explanation без exact evidence не має закривати finding.

Government data, authority та audit boundary

Government repositories можуть містити credentials, citizen-data access logic, procurement rules і safety-critical behavior. Repo access тому видається agent/service identity за least privilege; secrets redacted/injected only at runtime; network egress allowlisted; tool execution sandboxed; model/provider/data-residency contracts фіксуються у release envelope.

Audit trail повинен відповісти: який agent/model бачив який repo; які findings створив; який code запропонував; хто review/approved; які tests/checks пройшли; що реально deployed. Без цього 'AI знайшов проблему' важко перетворити на accountable public-sector change.

Failure modes, reconciliation та recovery

Failure modes: duplicate scan, stale repo snapshot, rules false positive, model false negative, generated patch changes behavior, build environment differs from prod, tool timeout after PR creation, secret leakage, prompt injection in code/comments, agent overload creates review queue. Critical scope escape зупиняє batch.

Write operations — branch/PR only із idempotency key. Після timeout система читає Git/CI state до retry. Scan batch checkpoint-иться по repo SHA; resume не повторює completed repositories без reason. Якщо model upgrade відбувся посеред campaign, результати різних revisions не зливаються без version marker і comparative eval.

Economics і як не збрехати самим собі цифрою '6.5 years → 20 hours'

20-hour scan і estimated 6.5-year manual equivalent — сильний signal про machine-scale coverage, але це не означає, що 6.5 років людської роботи повністю замінені 20 годинами. Люди лишаються потрібними для triage, false-positive handling, remediation review, domain validation, rollout і incident response.

Повний cost model: `model inference + parallel compute + repo/index IO + scanners + sandbox/build/CI + security review + remediation engineering + observability + incidents`. KPI: validated findings per cost, mean time finding→verified fix, false-positive/false-negative slices, critical escaped vulnerabilities, review hours, rollback rate і percentage of repos covered on fresh SHA.

Staged rollout і як повторити

Почніть із 20–50 repositories із відомими vulnerabilities та historical findings. Побудуйте deterministic first-stage scanner, evidence schema і read-only agent review. Потім додавайте candidate fixes/tests у isolated branches. Лише після stable precision/recall slices і security review масштабуйте parallelism.

Rollout: `historical replay → read-only scan → cited findings → remediation drafts → isolated build/tests → human-approved PRs → continuous red/blue checks → portfolio scale`. Для public sector додайте procurement/provider exit plan, data classification, audit retention і continuity. Production incident стає permanent regression test для конкретної vulnerability/workflow.

Практичні приклади

Приклад: vulnerability у legacy portal

Rules engine flag-ить pattern на pinned SHA. Claude reviews context, cites exact file/line і формує exploit explanation. Agent створює patch і tests у branch. CI/security checks проходять, engineer review-ить semantics, canary/rollback готові. Лише після approval patch shipping; повторний scan підтверджує finding closed.

FAQ

Чи Alberta дозволила ~50 agents самостійно patch production?

Публічний Anthropic case говорить про autonomous parallel scanning і генерацію fixes/tests, але прямо зазначає: перед shipping patch його review-ила й approve-ила команда.

Що означають 466 млн lines за 20 hours?

Це Anthropic/Government of Alberta-reported execution result конкретної implementation, не універсальний benchmark для будь-якого codebase.

Чому потрібен deterministic first stage?

Він дає відтворюваний signal для known patterns; Claude використовується для contextual review та evidence-backed triage, а не як єдиний scanner.

Чи 95% time/cost reduction уже доведені на всьому portfolio?

Ні. Alberta формулює це як target/claimed potential для modernization, тому AI-Magister не трактує 95% як незалежно підтверджений portfolio-wide outcome.

Пов’язані матеріали

Як League скоротив product cycle вдвічі з Claude у регульованому healthcare

Production-кейс League + Claude Enterprise/Claude Code: company-wide AI rollout, overnight coding agents, vendor-security reviews і finance automation — з жорстким відділенням protected health data, human sign-off та production authority.

Як Cyera зробила Claude Cowork front door до 40 enterprise tools без permission хаосу

Production-кейс Cyera + Claude Enterprise/Cowork: 1,500 employees, 40 tools, MCP, governed Snowflake analytics, legal/support/marketing agents — з data mapping, observability, human review і explicit write authority.

Як Vega будує agentic cyber defense на Claude: detection, triage, investigation, oversight

Production-кейс Vega Security + Claude Platform/Agent SDK: federated security-data access через Security Analytics Mesh, model routing за ризиком, окремі detection/triage/investigation/oversight agents, production evals і human sign-off для змін у detection logic.

Red teaming LLM-систем

Практичний red teaming перетворює припущення про безпеку LLM-системи на відтворювані атаки, докази та regression-тести. Розглядаємо threat model, ручні й автоматизовані кампанії, triage, безпечну лабораторію та перевірку виправлень.

Автономні coding agents

Автономні coding agents — практичний розбір production-архітектури: автоматизація змін коду в межах перевірного task contract, ізольованого середовища та обов’язкових repository gates. Матеріал охоплює контракти, межі повноважень, failure modes, оцінювання та контрольований rollout.

State machines для агентів

State machines для агентів — практичний розбір production-архітектури: відокремлення ймовірнісного рішення моделі від детермінованого життєвого циклу виконання. Матеріал охоплює контракти, межі повноважень, failure modes, оцінювання та контрольований rollout.

Джерела

  1. Government of Alberta uses Claude to find and fix cybersecurity vulnerabilities across government systemsофіційне
  2. Alberta sets North American standard for AIпервинне