Micro1 — стартап, що постачає компаніям розмічені й перевірені дані для тренування AI-моделей, — повідомив про річний дохід (gross run rate) на рівні $500 млн станом на серпень 2026 року. Це один із найвищих показників серед постачальників тренувальних даних і ознака того, наскільки прибутковим став ринок, який ще кілька років тому вважали технічною периферією AI-індустрії.

Run rate — це не аудитований річний дохід, а екстраполяція поточних місячних надходжень на 12 місяців вперед. Різниця важлива: показник відображає траєкторію компанії в конкретний момент, а не підтверджену річну виручку за звітний період. Втім, навіть як орієнтир цифра $500 млн показова — вона означає, що попит великих AI-лабораторій на якісні людські дані росте швидше, ніж постачальники встигають наростити пропозицію.

За даними TechCrunch, зростання Micro1 відбувається на тлі загального буму AI-тренування: лабораторії масово закуповують людську експертизу для розмітки, оцінки якості та курації даних, яких бракує у відкритому вебі.

Чому дані для тренування раптом коштують так дорого?

Тому що відкритий веб уже вичерпав себе як джерело якісних прикладів. Моделі 2023–2024 років тренували переважно на масовому скрейпі інтернету й дешевій крауд-розмітці — прості завдання на кшталт «відміть об'єкт на фото» коштували центи за штуку. Сучасні лабораторії натомість платять за складніші артефакти: ланцюжки міркувань для reasoning-моделей, експертні оцінки відповідей для RLHF, приклади коду й математичних доведень від інженерів і науковців із профільною освітою.

Це вже інша економіка: платити треба не за клік, а за годину роботи фахівця з профільною кваліфікацією, і саме тому ставки в цьому сегменті виросли на порядок за останні два-три роки.

Як такі компанії, як Micro1, монетизують дані?

Модель типова для сегмента: компанія будує мережу контракторів і профільних експертів, бере замовлення від AI-лабораторій на конкретні датасети чи оціночні pipeline, і монетизує різницю між ставкою для виконавця і ціною для клієнта. Ринок уже не порожній — на ньому також працюють Scale AI, Surge AI, Mercor та інші постачальники, які за останні два роки виросли з нішевих аутсорс-сервісів у мільярдні бізнеси, обслуговуючи великі AI-лабораторії. $500 млн run rate Micro1 показує, що місце на цьому ринку є не лише для одного-двох лідерів.

Що це означає для AI-білдерів і бізнесу?

Якість тренувальних даних стала окремою статтею бюджету, порівнянною за вагою з обчисленнями. Якщо команда fine-tune-ить модель під вузьку задачу, купити розмітку у спеціалізованого постачальника часто дешевше й швидше, ніж наймати й навчати власних анотаторів під разовий проєкт.

Це також пояснює, чому розрив у якості між моделями дедалі частіше визначається не архітектурою, а тим, хто які дані купив і в кого. Ми вже писали, що розрив між відкритими та закритими моделями тане вдвічі швидше — і доступ до якісних даних для fine-tuning усе частіше визначає, хто в цьому змаганні виграє.

Висновок AiiN

За нашою оцінкою, $500 млн run rate Micro1 — це не показник унікального продукту, а симптом ринку, де попит на людську експертизу для AI перевищує пропозицію настільки, що прибутковими стають навіть компанії, які просто добре організували мережу контракторів. Це ринок продавця: поки лабораторії конкурують за кожен відсоток якості моделі, постачальники даних диктують ціну. Для AI-білдерів висновок простий — бюджет на дані варто планувати як окрему статтю витрат, а не додаток до compute, і оцінювати постачальників не за обсягом розмітки, а за кваліфікацією людей, які її виконують.

Що таке gross run rate і чим він відрізняється від виручки?

Run rate — це прогнозний показник: поточний місячний дохід, помножений на 12. На відміну від річної виручки з фінансового звіту, він не проходить аудит і може суттєво змінюватися разом із коливаннями попиту від місяця до місяця.

Хто ще працює на ринку даних для тренування AI?

Серед відомих постачальників — Scale AI, Surge AI, Mercor та інші компанії, які надають розмітку, оцінку відповідей моделей і red-teaming для великих AI-лабораторій; Micro1 — один із гравців цього ж сегмента.

Чи варто стартапу купувати дані в такого постачальника, як Micro1?

Залежить від масштабу задачі: для разового або вузького датасету аутсорс зазвичай економічніший за найм власної команди анотаторів, а для продукту з постійним потоком даних власний pipeline розмітки окупається довгостроково.