Пекін розгортає стратегію, у якій головним експортним товаром китайського штучного інтелекту стають не чипи, а дані — масиви розмічених текстів, діалогів і мультимедійного контенту, на яких тренуються мовні моделі. За даними NYT, видання описує це в матеріалі від 17 серпня 2026 року як курс на те, щоб китайські дані живили штучний інтелект не лише всередині країни, а й у всьому світі.
Це логічне продовження курсу, який Пекін тримає останні два роки. Американський експортний контроль над чипами Nvidia змусив китайські компанії шукати інший важіль впливу на глобальний ринок ШІ — і дані виявилися ресурсом, який складніше заблокувати санкціями, ніж постачання кремнію. Ймовірно, саме тому відкриті китайські моделі вже помітно набирають користувачів у регіонах, чутливих до вартості API, — Південно-Східній Азії, Африці, Латинській Америці, хоча конкретних даних про частку ринку в цих регіонах NYT не наводить.
Для AI-білдерів це має практичне значення вже зараз. Китайські відкриті моделі — DeepSeek, Alibaba Qwen, Zhipu GLM, Moonshot Kimi — треновані саме на таких масивах даних і безкоштовно доступні для fine-tuning та self-hosting. Питання вже не в тому, чи використовувати їх, а в тому, наскільки глибоко вони вже вбудовані у ваш стек.
У чому суть китайської ставки на дані?
Суть — перетворити масштаб китайського цифрового ринку на сировину для тренування моделей і на послугу, яку можна експортувати. Йдеться про держрегульовані дата-біржі на кшталт Shanghai Data Exchange, індустрію розмітки даних, що обслуговує не лише внутрішніх, а й закордонних замовників, і політику полегшеного транскордонного обміну даними для «довірених» партнерів.
Паралельно Пекін підтримує випуск моделей із відкритими вагами — стратегію, протилежну підходу OpenAI чи Anthropic, які тримають ваги закритими. Відкриті ваги роблять китайські дані та архітектури де-факто стандартом для розробників у країнах, які не мають доступу до найдорожчих закритих API або хочуть уникнути залежності від одного постачальника.
Чому дані стали дефіцитним ресурсом у гонці ШІ?
Тому що якісний текст в інтернеті — вичерпний ресурс: провідні лабораторії ще у 2024–2025 роках попереджали, що обсяг публічних текстових даних, придатних для тренування, наближається до межі. Відповідь індустрії — синтетичні дані, розмітка людьми для reinforcement learning і мультимодальні джерела: відео, сенсорні дані, діалоги.
У кожному з цих напрямів Китай має перевагу: дешевша робоча сила для розмітки, величезні платформи з відео- та e-commerce-трафіком і державна інфраструктура для агрегації даних у масштабах, які приватні компанії на Заході не можуть відтворити без окремого регуляторного дозволу щодо приватності.
Кому це вигідно, а кого це турбує?
Ставка Пекіна на дані ділить гравців глобального ринку ШІ на тих, хто виграє, і тих, хто ризикує:
- AI-стартапам поза США й Китаєм — дешевший доступ до конкурентних відкритих моделей без вендор-локу;
- урядам, які хочуть суверенний ШІ-стек без залежності від Кремнієвої долини;
- регуляторам у Європі та США — навпаки, масовий імпорт китайських дата-сетів і моделей піднімає питання приватності, вбудованої в тренувальні дані цензури та експортного контролю, який тепер може стосуватися даних, а не лише чипів.
Ймовірно, найближчим кроком стане не пряма заборона китайських моделей, а вимога прозорості щодо походження тренувальних даних — за аналогією з тим, як ЄС уже вимагає розкриття джерел даних за AI Act.
Що з цього випливає для AI-білдерів: погляд AiiN
Наша теза проста: перевага в чипах більше не гарантує перевагу в моделях, якщо суперник вирівнює рахунок перевагою в даних і роздає результат безкоштовно у вигляді відкритих ваг. Для команд, які будують продукти на LLM, вибір базової моделі стає геополітичним рішенням не менше, ніж технічним, — і варто закладати multi-model архітектуру, яка не залежить від одного постачальника чи однієї юрисдикції.
Ми вже писали, як китайська GLM-5.3 конкурує на рівних із західними флагманами — і ставка Пекіна на дані означає, що таких релізів найближчим часом стане ще більше.
Чи стануть китайські моделі стандартом за замовчуванням для розробників?
Не обов'язково стандартом за замовчуванням, але точно одним із головних варіантів вибору поруч із закритими моделями OpenAI, Google і Anthropic — особливо для команд, які цінують низьку вартість, гнучкість ліцензії та можливість self-hosting без залежності від хмарного API.
Чи безпечно використовувати китайські відкриті моделі в комерційних продуктах?
Технічно так: ліцензії більшості з них, зокрема DeepSeek і Qwen, дозволяють комерційне використання. Але варто перевірити дата-резидентність, вбудовану чутливість до тем, «незручних» для китайського регулятора, і відповідність вимогам вашого ринку щодо походження даних, перш ніж виводити продукт на основі такої моделі в прод.