Holo4-27B набирає 61,7% на OSWorld 2.0, а Holo4-35B-A3B — 30,9%.
Holo4 — нова серія агентних моделей H company для керування комп’ютером. Модель працює через GUI, код, MCP та API без зміни моделі й способу виклику, тому один агент покриває десктоп, веб, Android, пісочницю для коду та бізнес-API. Для команди це менше інтеграцій між вузькими моделями й один білінг через H Models API. За даними Hugging Face, H company будувала Holo4 для реальних бізнес-процесів, а не лише для академічних рейтингів.
Що вміє Holo4 і де він працює?
Holo4 клікає та друкує на екрані, пише й запускає власний код, а також викликає MCP- та API-інструменти. Модель сама обирає інтерфейс під завдання, бо робота поєднує GUI, код і виклики API в межах одного бізнес-процесу. Так зникає типова межа: GUI-модель губиться без екрана, а модель, що полюбляє виклики інструментів, зупиняється перед застосунком без API.
Holo4 працює на десктопі, у вебі, на Android, у пісочниці для коду та проти бізнес-API, і всюди викликається однаково. Серія має два розміри: Holo4-27B як dense-модель і Holo4-35B-A3B як Mixture of Experts. Обидві доступні на H Models API, разом з оновленим Holotron4 Nano, а повна колекція ваг вийшла у FP16, FP8 і GGUF.
Навчання Holo4 поєднувало supervised і reinforcement learning на великому наборі середовищ і завдань, зокрема згенерованих Agentic Task Factory. Це орієнтує модель на професійний софт, де агент мусить тримати довгий контекст і комбінувати дії.
Яка точність і ціна на OSWorld 2.0?
Розрив із найсильнішими закритими моделями зберігається: Opus 5.5 набирає на тому самому бенчмарку 81,8%. Holo4 компенсує це у десятки разів меншою кількістю параметрів і нижчою вартістю завдання, тож для білдера це кандидат у базу для computer-use агентів без залежності від закритих моделей.
На AutomationBench для роботи з API ситуація схожа: Holo4 конкурує з найсильнішими закритими моделями за ціною завдання. Вартість прогонів H company рахує з вхідних і вихідних токенів кожного агентного запуску, але релізи, тестові обстановки та підвибірки завдань між моделями різняться, тож бали з різних обстановок між собою не порівнюються.
Усі траєкторії, що стоять за оцінками на публічних бенчмарках, H company відкриває: кроки можна переглянути у viewer на trajectories.hcompany.ai або завантажити датасет із Hugging Face для власного аудиту.
Що показують завдання у FreeCAD і Godot?
Holo4-27B виконує професійні завдання у FreeCAD і Godot за тим самим промптом і тестовою обстановкою, що й базова Qwen3.8 27B, тому різниця в результаті показує приріст від навчання H company, а не зміну умов тесту.
Вежа Eiffel Tower у FreeCAD вимагає квадратного плану на кожній висоті, криволінійного профілю ніжок і трьох платформ. На неї Holo4-27B витрачає 84 виклики та 1,3 млн токенів проти 60 викликів і 1,0 млн токенів у Qwen3.8 27B. Логотип H у FreeCAD коштує Holo4-27B 94 виклики та 1,5 млн токенів проти 118 викликів і 1,9 млн токенів у базової моделі. Гра у стилі Pac-Man у Godot має працювати без нагляду: з автопілотом гравця, підрахунком очок і життів.
З чого почати команді?
- Перегляньте 2-3 траєкторії Holo4 у viewer на trajectories.hcompany.ai і звірте кількість кроків зі своїм сценарієм.
- Прогоніть Holo4-27B через H Models API на 5-10 власних задачах із GUI та API й зафіксуйте токени та час на завдання.
- Порівняйте Holo4-27B із поточним стеком на одній і тій самій тестовій обстановці, щоб різниця в точності була вимірюваною.
- Тримайте FP8 або GGUF для локальних тестів, поки не перевірите агента за власним чеклістом безпеки.









