Anthropic перевірила одну зі своїх ще не випущених моделей на одній із найбільших нерозв'язаних задач математики і зафіксувала реальний прогрес: За даними TechCrunch, це сталося 11 серпня 2026 року, хоча компанія поки не розкрила ні назву моделі, ні саму задачу. Відомо лише, що йдеться про одну зі старих і добре відомих математичних проблем, над якою десятиліттями б'ються професійні математики.
Для індустрії це не перший подібний сигнал. Спершу DeepMind показала на Міжнародній математичній олімпіаді 2024 року, що система AlphaProof здатна розв'язувати олімпіадні задачі на рівні срібного медаліста, а вже влітку 2025-го моделі OpenAI дотягнулись до золотої медалі IMO. Паралельно математики почали активно використовувати LLM не як «розв'язувачів», а як дослідницьких асистентів — найвідоміший приклад: база відкритих проблем Ердеша erdosproblems.com, де в 2025 році сучасні моделі кілька разів допомагали знаходити забуті публікації або пропонувати часткові розв'язки для задач, які роками вважалися відкритими. Ми вже писали про те, як інші свіжі релізи Anthropic та конкурентів змінюють інструментарій AI-білдерів. Новина про Anthropic вписується саме в цю тенденцію, хоча TechCrunch не уточнює, чи модель діяла автономно, чи в парі з математиками-людьми.
Головна інтрига — не сам факт прогресу, а те, що модель ще не випущена публічно. Це означає, що Anthropic тестує математичні здібності на внутрішніх білдах задовго до релізу, і, ймовірно, саме такі результати визначають, коли і в якому вигляді модель зрештою потрапить користувачам.
Що саме зробила модель, за даними TechCrunch?
За інформацією видання, нерелізована модель Anthropic просунулась у розв'язанні задачі, яку відносять до найважчих у сучасній математиці — без конкретизації назви чи галузі: теорія чисел, комбінаторика чи щось інше. Формулювання TechCrunch навмисно обережне: йдеться про «прогрес», а не про «розв'язання» чи «доведення». Це важлива відмінність, яку варто тримати в голові, читаючи будь-які заголовки про AI і математику.
Anthropic традиційно не поспішає з гучними заявами про наукові прориви — на відміну від деяких конкурентів, компанія рідше публікує окремі дослідницькі анонси про математичні бенчмарки. Те, що інформація просочилась через TechCrunch, а не через офіційний блог Anthropic, натякає: або витік стався до готовності офіційного анонсу, або компанія свідомо тестує реакцію ринку перед релізом.
Чому саме нерозв'язані математичні задачі — хороший тест для AI?
Відкриті математичні проблеми складно «нахитрувати» бенчмарком: відповіді на них не існує в жодному датасеті для тренування, тому що жива людина її ще не знайшла. Це відрізняє такі задачі від, наприклад, тестів на кшталт MMLU чи навіть олімпіадних задач IMO, де рішення в принципі існують і теоретично могли просочитися в тренувальні дані.
- Немає ризику контамінації датасету — відповіді фізично не існувало на момент тренування.
- Прогрес легко верифікувати незалежно — математичний доказ або контрприклад або правильний, або ні.
- Результат має цінність поза AI-індустрією — навіть часткове просування визнає математична спільнота, а не лише маркетинг компанії.
Саме тому нерозв'язані задачі — один із небагатьох бенчмарків, де прогрес моделі неможливо симулювати переказом чужих рішень.
Наскільки серйозний цей прогрес насправді?
Поки що з відкритих джерел незрозуміло, чи йдеться про повне доведення, часткове звуження умов задачі, новий підхід до відомого підвипадку чи просто корисну підказку для математиків-людей. Досвід останніх двох років показує: у переважній більшості випадків AI-моделі дають саме часткові результати — нову оцінку, контрприклад для вужчого випадку або структуровану підказку, яку потім людина доводить до повного доказу.
Це не применшує значення новини. Навіть часткове зрушення у задачі, яка не піддавалась математикам роками, — це вимірюваний сигнал про те, що reasoning-моделі нового покоління справді здатні генерувати оригінальні математичні ідеї, а не лише відтворювати відомі техніки в новій комбінації.
Що з цим робити AI-білдерам просто зараз?
Поки що — нічого конкретного, окрім спостереження. Модель нерелізована, і невідомо, чи потрапить її математичний reasoning у публічний API взагалі, чи залишиться внутрішнім дослідницьким інструментом. Але сама подія — сигнал, вартий уваги розробників, які будують продукти на reasoning-моделях:
- Очікуйте, що наступне покоління Claude отримає помітно сильніший математичний і formal-reasoning шар — це типовий шлях Anthropic: спершу внутрішній research-бенчмарк, потім продуктова фіча.
- Для задач, де потрібна перевірювана коректність (фінансові розрахунки, наукові пайплайни, formal verification), закладайте в архітектуру продукту зовнішню верифікацію відповіді моделі, а не довіряйте reasoning наосліп.
- Anthropic вже впровадила прихований слід у вихідному тексті Claude — компанія системно інвестує в перевірюваність результатів моделі, і математичний reasoning вписується в ту саму логіку.
Висновок AiiN: головна цінність цієї новини — не в конкретній математичній задачі, а в тому, що вона показує зміщення метрики прогресу LLM. Компанії більше не змагаються лише бенчмарками на кшталт MMLU чи HumanEval, які можна «вивчити напам'ять» через тренувальні дані, — вони переходять до задач, де відповіді на момент тренування взагалі не існувало. Для AI-білдерів це означає, що оцінювати нові моделі варто не за таблицями лідерів, а за тим, чи компанія публікує верифіковані, незалежно перевірені результати на задачах без відомої відповіді. Саме так, а не рекламними цифрами, тепер вимірюється реальний reasoning-стрибок.
Чи означає це, що AI незабаром самостійно доведе гіпотезу Рімана?
Ні, і TechCrunch про це не заявляє. Йдеться про прогрес в одній конкретній задачі, а не про універсальну здатність моделі розв'язувати будь-які відкриті проблеми математики. Гіпотеза Рімана та подібні до неї задачі тисячоліття залишаються відкритими навіть для найсильніших сучасних reasoning-систем.
Коли Anthropic випустить цю модель публічно?
Дата релізу невідома — TechCrunch не називає навіть орієнтовний таймлайн. Anthropic історично тестує сильні research-версії моделей місяцями до публічного релізу, тож проміжок між цією новиною і появою моделі в Claude API може становити від кількох тижнів до кількох кварталів.
Чим це відрізняється від математичних рекордів OpenAI та DeepMind?
Головна відмінність — формат задачі. Результати DeepMind і OpenAI на IMO показують силу моделі на закритих олімпіадних задачах із заздалегідь відомим правильним розв'язком. Тут же йдеться про справді відкриту, невирішену проблему, де немає гарантії, що розв'язок узагалі існує в осяжному вигляді, — це складніший і менш контрольований тест.