WARP — це той рідкісний випадок, коли C-рушій для інференсу MoE-моделей обходиться без будь-якого стороннього рантайму, а пам’ять економлять так, що навіть на MacBook Pro з 64 ГБ RAM можна запустити повну модель Kimi K3 на 2,78 трильйона параметрів прямо з NVMe-диска. Швидкість? 0,45–0,62 токена за секунду — не рекорд, але для такої махини без GPU це як мінімум цікаво. А якщо потрібно щось легше, є Kimi-Linear на 48 мільярдів параметрів: вміщається в 19 ГБ контейнера, займає всього 1,32 ГБ оперативки і видає вже 10,6 токенів/с. Все це — без CUDA, без BLAS, з мінімальним стеком на C11 і Python лише для конвертації та сервера, сумісного з OpenAI.
Що таке WARP і чим він унікальний
WARP — це рушій інференсу, написаний на чистому C без жодних залежностей від сторонніх рантаймів. Його головна фішка: він оптимізований спеціально для Mixture of Experts (MoE) моделей, які зазвичай вимагають тонни пам’яті. Замість того, щоб тримати всіх експертів у RAM, WARP зберігає лише загальну частину моделі, а решту підвантажує прямо з NVMe-диска — і робить це настільки ефективно, що навіть на ноутбуці з 64 ГБ RAM можна запустити гіганта на кшталт Kimi K3 (2,78 трильйона параметрів) зі швидкістю 0,45–0,62 токена за секунду.
Чому це важливо? Бо більшість сучасних MoE-моделей просто не поміщаються в оперативну пам’ять звичайних машин. WARP вирішує цю проблему, мінімізуючи вимоги до RAM: наприклад, для Kimi-Linear 48B (19 ГБ на диску) потрібно всього 1,32 ГБ оперативки, а швидкість інференсу при цьому — 10,6 токенів/с. І все це без GPU, CUDA чи BLAS — лише C11 та Python для конвертації моделей та запуску OpenAI-сумісного сервера.
Проєкт повністю відкритий, збирається через make, тестується за допомогою make check, і не потребує нічого, крім компілятора та бажання експериментувати. Якщо вам потрібен інференс без накладних витрат — WARP вартий уваги.
Продуктивність WARP: тести та цифри
WARP доводить, що інференс MoE-моделей можна робити швидко — навіть без GPU. На MacBook Pro з 64 ГБ RAM повна модель Kimi K3 (2,78T параметрів у 982-гігабайтному контейнері) генерує токени зі швидкістю 0,45–0,62 за секунду. Так, це не сотні токенів, але враховуючи розмір моделі та відсутність відеокарти — результат вражає. Експерти підвантажуються прямо з NVMe, а загальна частина моделі сидить в оперативці, мінімізуючи затримки.
З Kimi-Linear 48B WARP показує зовсім іншу картину: 10,6 токенів/с на тій самій машині. Модель займає лише 19 ГБ на диску, а в RAM потрібно всього 1,32 ГБ. Різниця в продуктивності пояснюється просто: менша модель, менше експертів, швидше перемикання. Обидва тести підтверджують головну фішку WARP — ефективне використання ресурсів. Немає BLAS, немає CUDA, лише чистий C11 і мінімум залежностей. Навіть Python тут лише для конвертації моделей та запуску OpenAI-сумісного сервера.
Збірка через make, тести через make check — все прозоро й передбачувано. WARP не претендує на рекордні швидкості, але дає змогу запускати великі моделі там, де це здавалося неможливим: на ноутбуці, без хмарних GPU, без складних налаштувань. І головне — без компромісів з безпекою чи стабільністю.
Технічний стек та простота інтеграції
WARP — це мінімалістичний движок для інференсу MoE-моделей, написаний на чистому C11 без сторонніх рантаймів. Стек технологій навмисно лаконічний: C для ядра, Python — лише для конвертації моделей та запуску OpenAI-сумісного сервера. Ніяких GPU, CUDA чи BLAS: все працює на CPU, а експерти підвантажуються прямо з NVMe-диска, економивши оперативну пам’ять.
Збірка проста: make — і готово. Тестування? make check перевірить коректність роботи на прикладі Kimi-Linear 48B (19 ГБ контейнер, 1,32 ГБ RAM, 10,6 токен/с на MacBook Pro). Для повнорозмірних моделей, як-от Kimi K3 2,78T (982 ГБ), WARP утримує загальну частину в RAM, а експертів підвантажує на льоту — швидкість 0,45–0,62 токен/с на тій самій машині з 64 ГБ пам’яті.
Код відкритий і доступний на GitHub. Інтеграція — справа кількох команд: конвертуєш модель, запускаєш сервер, і готово — OpenAI-сумісний API працює без додаткових залежностей. Просто, швидко, без магії.
Як WARP впливає на розробників AI та SEO-фахівців
WARP — це прорив для розробників AI, які втомилися від залежності від дорогих GPU. Тепер великі MoE-моделі, як-от Kimi K3 на 2,78 трильйона параметрів, можна запускати на звичайному MacBook Pro з 64 ГБ RAM — без хмарних сервісів чи спеціалізованих відеокарт. Швидкість? До 0,62 токена/с для гігантських моделей і 10,6 токенів/с для полегшених версій (наприклад, Kimi-Linear 48B, яка займає всього 1,32 ГБ пам’яті). Це означає: локальна розробка, швидке тестування ідеї та мінімум накладних витрат на інфраструктуру.
Для SEO-фахівців WARP відкриває нові горизонти. Локальний інференс дозволяє аналізувати контент у реальному часі без затримок на запити до зовнішніх API. Уявіть: ви генеруєте оптимізовані тексти прямо на ноутбуці, тестуєте їхню релевантність за допомогою MoE-моделей і відразу бачите результат — без обмежень хмарних тарифів. А ще це крок до персоналізації контенту на льоту: моделі зможуть адаптуватися до конкретної аудиторії без ризику витоку даних.
Майбутнє MoE-моделей з WARP виглядає ще привабливіше. Зараз движок працює з контейнерами розміром від 19 ГБ (як Kimi-Linear) до майже терабайта (повна Kimi K3), але оптимізація триває. Очікуйте, що вже скоро навіть смартфони зможуть запускати полегшені версії таких моделей — це змінить правила гри в edge AI. Для розробників це шанс створювати продукти, які раніше здавалися фантастикою: автономні чат-боти, офлайн-аналітика великих даних, вбудовані AI-асистенти в мобільних додатках.

Андрій Красовський — програміст і дата-сайєнтист з досвідом у створенні складних автоматизованих систем на базі Python, Google Colab та n8n. Його експертиза охоплює побудову SEO-екосистем, інтеграцію API (Ahrefs, Google Ads, Search Console) та побудову пайплайнів для контенту. Андрій поєднує технічну точність із підприємницьким баченням, допомагаючи створювати рішення, що працюють на результат.