Як Model ML доводить AI-фінансовий аналіз до редагованих PowerPoint і Excel з GPT-5.6 Sol
Production-кейс Model ML: agent планує finance workflow, збирає та звіряє evidence, виконує розрахунки й створює редаговані PowerPoint/Excel із traceable sources, залишаючи assumptions і фінальне судження людині.
Картка кейсу
Що тут автоматизовано
Обсяг автоматизації
Model ML проводить finance assignment від brief через research, calculations і evidence reconciliation до native editable deck або workbook. Core agent планує роботу, вибирає tools/models, працює з integrations і document tooling; finance professional перевіряє assumptions, sources, numbers і message перед sharing.
Роль людини
Finance professional задає brief, materiality і constraints, перевіряє source lineage, assumptions, formulas, valuation logic, claims і final narrative. Investment, client-facing або regulated decisions не делегуються лише на підставі model output.
Заявлені результати
- GPT-5.6 Sol produced a .pptx in 100% of Model ML PowerPoint test cases versus 76% for Opus 5
- Professional-readiness gate: 43.3% for GPT-5.6 Sol versus 26.7% for Opus 5 in Model ML Composite
- ~21% fewer tokens per PowerPoint deck than Fable 5 in the reported benchmark
- One bespoke tearsheet workflow reportedly fell from about one hour to about five minutes at a global asset manager
OpenAI customer story + Model ML primary documentation. Benchmark figures are Model ML/OpenAI-reported results from Model ML Composite evaluations or named customer workflows, not independent market-wide benchmarks. AI-Magister governance controls are reproduction guidance.
Зміст статті
- 01Бізнес-задача: автоматизувати last mile фінансової роботи, а не лише чернетку
- 02Trigger, input, AI stage, tools та output
- 03Workflow, HITL та autonomy A3
- 04Reported eval metrics: сильний результат із важливими нюансами
- 05Error handling, controls, frequency, scalability і cost
- 06Кому підходить і як повторити без фінансової магії
Передумови
Бізнес-задача: автоматизувати last mile фінансової роботи, а не лише чернетку
У finance складність часто починається після першого аналізу: треба звірити джерела, перевірити числа, побудувати формули, оформити editable deck або workbook і зробити кожне твердження придатним до scrutiny. Model ML будує agent workflow саме навколо цього last mile. За OpenAI, core agent отримує brief і source material, планує роботу, проводить research і calculations, reconciles evidence та повертає native PowerPoint або Excel, а не flatten-нуту картинку чи текстову пораду.
Це важлива архітектурна різниця: output contract включає структуру файлу, formulas, source traceability і можливість професіонала продовжити роботу вручну. Красивий PDF без lineage у due diligence — це не автоматизація, а дуже дорога листівка.
architecture
Карта системи: Як Model ML доводить AI-фінансовий аналіз до редагованих PowerPoint і Excel з GPT-5.6 Sol
Trigger, input, AI stage, tools та output
Trigger — finance brief з email, Model ML app або Office workflow: investment committee deck, tearsheet, comparable-company analysis, client model чи великий data-room review. Input — user brief, templates, internal files, CRM/cloud data та trusted market-data sources. Model ML primary docs описують integrations з Outlook/Gmail, SharePoint/OneDrive/Google Drive, Snowflake/Databricks, Salesforce/DealCloud/Affinity та іншими системами; конкретний deployment має обмежувати їх least-privilege scopes.
AI stage розбиває assignment на research, extraction, calculation, reconciliation і document-generation steps, завантажуючи потрібні toolkits. Output — native editable `.pptx` або workbook із formulas/structure і traceable sources. Для long-running research корисно зберігати source snapshot/version, щоб review через день не порівнював числа з уже оновленим market data без пояснення.
- Trigger → brief, scheduled module або source event;
- Input → documents, templates, internal data, market data, instructions;
- AI → plan, research, calculate, reconcile, generate;
- Integrations → email, cloud storage, Office, CRM/data platforms;
- Output → editable deck/workbook + source lineage + review state.
timeline
Контрольні точки для практичного застосування
- Trigger → brief, scheduled module або source event;
Контрольна теза з матеріалу статті.
- Input → documents, templates, internal data, market data, instructions;
Контрольна теза з матеріалу статті.
- AI → plan, research, calculate, reconcile, generate;
Контрольна теза з матеріалу статті.
- Integrations → email, cloud storage, Office, CRM/data platforms;
Контрольна теза з матеріалу статті.
- Output → editable deck/workbook + source lineage + review state.
Контрольна теза з матеріалу статті.
- cost-optimization-llm
Workflow, HITL та autonomy A3
Reproduction workflow: `brief → permission check → source inventory → plan → evidence extraction → calculations → reconciliation → draft artifact → deterministic checks → visual/semantic review → human judgment → share`. OpenAI прямо описує finance professional, який перевіряє assumptions, sources і message перед sharing. Тому A3: agent може автономно виконати велику частину artifact production, але substantive judgment і consequential distribution залишаються bounded.
Approval має бути action-bound: «дозволяю використати цей data room для analysis» не означає «дозволяю відправити результат клієнту». Для workbook потрібні окремі checks на formulas, broken references, hidden sheets, unit/currency consistency і key-output reconciliation; для deck — source-backed claims, chart data, disclosure text і layout integrity.
Reported eval metrics: сильний результат із важливими нюансами
У Model ML Composite для native PowerPoint OpenAI наводить 100% items yielding a `.pptx` для GPT-5.6 Sol проти 76% для Opus 5 та professional-readiness rate 43.3% проти 26.7%. У тому ж benchmark GPT-5.6 Sol використовував приблизно на 21% менше tokens per deck, ніж Fable 5. Для Excel headline accuracy GPT-5.6 Sol була 83.3%, але fully correct models — 50%, нижче за 60% для Opus 5 і Fable 5 у наведеній таблиці.
Це чудовий приклад, чому не можна перетворювати один leaderboard score на маркетингову релігію: модель може виграти за deliverability і програти за часткою fully correct workbooks. Дані є Model ML/OpenAI-reported benchmark results. Для власного use case потрібен свій golden set із реальними templates, formulas, disclosures, currencies і review standards.
Error handling, controls, frequency, scalability і cost
Failure modes: неправильна одиниця або currency, stale market data, formula без expected dependency, missing source, unsupported claim, красиво оформлена помилкова цифра, accidental data egress, template drift і partial generation після timeout. Controls: source allowlist, snapshot/versioning, cell-level or claim-level provenance, structured calculation intermediates, schema checks, formula tests, deterministic tie-outs, sandboxed code execution, redaction policy, approval перед external sharing і artifact checksum/version.
Scheduled workflows на кшталт earnings summaries можна запускати event-driven, а ad-hoc decks — on demand. Scalability упирається не лише в tokens, а в data-provider limits, document tooling, reviewer capacity і expensive retries. Cost model має включати model tokens, document/code tools, data subscriptions, storage, observability/evals і review time. Найкраща одиниця — cost per review-ready artifact, а не cost per generated slide.
Кому підходить і як повторити без фінансової магії
Патерн підходить investment banking, PE, asset management, research, consulting і finance teams із повторюваними deliverables та формалізованими templates. Requirements: licensed data access, template library, source lineage, model/tool permissions, deterministic validation і reviewer ownership. Не починайте з автоматичного investment recommendation; почніть із bounded artifact, де correctness можна перевірити.
Зберіть 30–50 historical decks/workbooks із briefs, source packages і accepted final outputs. Побудуйте rubric для key outputs, formulas, citations, structure, visual quality і review effort. Запустіть offline replay на кількох model/tool configurations, потім shadow generation, human-reviewed production і canary для одного deliverable type. Кожен escaped numerical/source defect перетворюйте на permanent regression case.
- Вибрати один повторюваний finance deliverable.
- Зафіксувати golden outputs і source snapshots.
- Розділити deterministic calculations та model judgment.
- Побудувати claim/formula/source checks.
- Міряти review-ready rate і reviewer minutes.
- Запустити shadow → draft-review → bounded production.
- Не підвищувати autonomy без numerical regression suite.
Практичні приклади
Приклад: investment deck з цифрою, що змінилася після source refresh
Agent створив deck на snapshot T0. Перед sharing market-data source оновився. Release check порівнює source versions, позначає material delta і блокує silent reuse старої цифри. Reviewer або reruns calculation, або явно приймає T0 snapshot із disclosure.
FAQ
Чи 100% `.pptx` production rate означає 100% правильних презентацій?
Ні. Це deliverability metric у Model ML Composite. Professional-readiness rate у тому ж reported benchmark становила 43.3%, а quality має окремі dimensions.
Чому Excel потребує жорсткіших deterministic checks?
Бо природно написаний фінансовий висновок не компенсує неправильну формулу, unit або hidden dependency. Key outputs і tie-outs треба перевіряти окремо від language quality.
Який мінімальний rollout?
Один тип артефакту, historical golden set, shadow generation, human review і тільки потім bounded production. Автоматизувати весь investment process одним махом — це не сміливість, а недорогий спосіб познайомитися з audit committee.
Пов’язані матеріали
Production-кейс RingCentral: ChatGPT Work і Codex використовуються для product delivery та PMO — з Jira, Sheets і CRM context, human review, release governance та вимірним rollout.
Як Zapier автоматизує QA/QC тисяч inbound leads і знаходить втрачений pipeline з ChatGPT WorkProduction-кейс Zapier: ChatGPT Work аналізує funnel events, автоматизує QA/QC на тисячах leads, виявляє recurring drop-offs і готує campaign assets — з окремими attribution, data-governance та write-control gates.
Структуровані відповіді LLMЯк перетворити довільний текст моделі на версіонований контракт даних із валідацією, retry, семантичною перевіркою та безпечним fallback.
Оцінювання LLM-систем у productionЯк побудувати evaluation set, автоматичні та людські метрики, regression gates і спостережуваність для промптів, RAG та агентів.
Оптимізація вартості LLM-системЯк зменшувати витрати без сліпого downgrade: unit economics, token budgets, model routing, caching, batching, retrieval, observability і quality-adjusted cost.