Перейти до вмісту

WARP: безрантаймовий рушій інференсу для MoE-моделей на C

</> Версія для ШІ

WARP — це той рідкісний випадок, коли C-рушій для інференсу MoE-моделей обходиться без будь-якого стороннього рантайму, а пам’ять економлять так, що навіть на MacBook Pro з 64 ГБ RAM можна запустити повну модель Kimi K3 на 2,78 трильйона параметрів прямо з NVMe-диска. Швидкість? 0,45–0,62 токена за секунду — не рекорд, але для такої махини без GPU це як мінімум цікаво. А якщо потрібно щось легше, є Kimi-Linear на 48 мільярдів параметрів: вміщається в 19 ГБ контейнера, займає всього 1,32 ГБ оперативки і видає вже 10,6 токенів/с. Все це — без CUDA, без BLAS, з мінімальним стеком на C11 і Python лише для конвертації та сервера, сумісного з OpenAI.

Що таке WARP і чим він унікальний

WARP — це рушій інференсу, написаний на чистому C без жодних залежностей від сторонніх рантаймів. Його головна фішка: він оптимізований спеціально для Mixture of Experts (MoE) моделей, які зазвичай вимагають тонни пам’яті. Замість того, щоб тримати всіх експертів у RAM, WARP зберігає лише загальну частину моделі, а решту підвантажує прямо з NVMe-диска — і робить це настільки ефективно, що навіть на ноутбуці з 64 ГБ RAM можна запустити гіганта на кшталт Kimi K3 (2,78 трильйона параметрів) зі швидкістю 0,45–0,62 токена за секунду.

Чому це важливо? Бо більшість сучасних MoE-моделей просто не поміщаються в оперативну пам’ять звичайних машин. WARP вирішує цю проблему, мінімізуючи вимоги до RAM: наприклад, для Kimi-Linear 48B (19 ГБ на диску) потрібно всього 1,32 ГБ оперативки, а швидкість інференсу при цьому — 10,6 токенів/с. І все це без GPU, CUDA чи BLAS — лише C11 та Python для конвертації моделей та запуску OpenAI-сумісного сервера.

Проєкт повністю відкритий, збирається через make, тестується за допомогою make check, і не потребує нічого, крім компілятора та бажання експериментувати. Якщо вам потрібен інференс без накладних витрат — WARP вартий уваги.

Продуктивність WARP: тести та цифри

WARP доводить, що інференс MoE-моделей можна робити швидко — навіть без GPU. На MacBook Pro з 64 ГБ RAM повна модель Kimi K3 (2,78T параметрів у 982-гігабайтному контейнері) генерує токени зі швидкістю 0,45–0,62 за секунду. Так, це не сотні токенів, але враховуючи розмір моделі та відсутність відеокарти — результат вражає. Експерти підвантажуються прямо з NVMe, а загальна частина моделі сидить в оперативці, мінімізуючи затримки.

З Kimi-Linear 48B WARP показує зовсім іншу картину: 10,6 токенів/с на тій самій машині. Модель займає лише 19 ГБ на диску, а в RAM потрібно всього 1,32 ГБ. Різниця в продуктивності пояснюється просто: менша модель, менше експертів, швидше перемикання. Обидва тести підтверджують головну фішку WARP — ефективне використання ресурсів. Немає BLAS, немає CUDA, лише чистий C11 і мінімум залежностей. Навіть Python тут лише для конвертації моделей та запуску OpenAI-сумісного сервера.

Збірка через make, тести через make check — все прозоро й передбачувано. WARP не претендує на рекордні швидкості, але дає змогу запускати великі моделі там, де це здавалося неможливим: на ноутбуці, без хмарних GPU, без складних налаштувань. І головне — без компромісів з безпекою чи стабільністю.

Технічний стек та простота інтеграції

WARP — це мінімалістичний движок для інференсу MoE-моделей, написаний на чистому C11 без сторонніх рантаймів. Стек технологій навмисно лаконічний: C для ядра, Python — лише для конвертації моделей та запуску OpenAI-сумісного сервера. Ніяких GPU, CUDA чи BLAS: все працює на CPU, а експерти підвантажуються прямо з NVMe-диска, економивши оперативну пам’ять.

Збірка проста: make — і готово. Тестування? make check перевірить коректність роботи на прикладі Kimi-Linear 48B (19 ГБ контейнер, 1,32 ГБ RAM, 10,6 токен/с на MacBook Pro). Для повнорозмірних моделей, як-от Kimi K3 2,78T (982 ГБ), WARP утримує загальну частину в RAM, а експертів підвантажує на льоту — швидкість 0,45–0,62 токен/с на тій самій машині з 64 ГБ пам’яті.

Код відкритий і доступний на GitHub. Інтеграція — справа кількох команд: конвертуєш модель, запускаєш сервер, і готово — OpenAI-сумісний API працює без додаткових залежностей. Просто, швидко, без магії.

Як WARP впливає на розробників AI та SEO-фахівців

WARP — це прорив для розробників AI, які втомилися від залежності від дорогих GPU. Тепер великі MoE-моделі, як-от Kimi K3 на 2,78 трильйона параметрів, можна запускати на звичайному MacBook Pro з 64 ГБ RAM — без хмарних сервісів чи спеціалізованих відеокарт. Швидкість? До 0,62 токена/с для гігантських моделей і 10,6 токенів/с для полегшених версій (наприклад, Kimi-Linear 48B, яка займає всього 1,32 ГБ пам’яті). Це означає: локальна розробка, швидке тестування ідеї та мінімум накладних витрат на інфраструктуру.

Для SEO-фахівців WARP відкриває нові горизонти. Локальний інференс дозволяє аналізувати контент у реальному часі без затримок на запити до зовнішніх API. Уявіть: ви генеруєте оптимізовані тексти прямо на ноутбуці, тестуєте їхню релевантність за допомогою MoE-моделей і відразу бачите результат — без обмежень хмарних тарифів. А ще це крок до персоналізації контенту на льоту: моделі зможуть адаптуватися до конкретної аудиторії без ризику витоку даних.

Майбутнє MoE-моделей з WARP виглядає ще привабливіше. Зараз движок працює з контейнерами розміром від 19 ГБ (як Kimi-Linear) до майже терабайта (повна Kimi K3), але оптимізація триває. Очікуйте, що вже скоро навіть смартфони зможуть запускати полегшені версії таких моделей — це змінить правила гри в edge AI. Для розробників це шанс створювати продукти, які раніше здавалися фантастикою: автономні чат-боти, офлайн-аналітика великих даних, вбудовані AI-асистенти в мобільних додатках.

Krasovskiy Blog