ИИ-модуль в смартфонах Huawei — это специализированный блок нейропроцессора (NPU), интегрированный в системные кристаллы серии Kirin для выполнения задач машинного обучения напрямую на устройстве. В отличие от центрального (CPU) или графического (GPU) процессоров, NPU оптимизирован под матричные вычисления с низкой точностью (INT8, FP16), что дает колоссальный прирост производительности на задачах инференса при минимальном энергопотреблении. Именно этот аппаратный блок позволяет флагманам серии Mate и P распознавать сцены в камере, транскрибировать речь офлайн и анимировать аватары в реальном времени без отправки данных в облако.

Архитектура нейроблока эволюционировала от отдельного сопроцессора Cambricon 1A в Kirin 970 до собственной разработки Huawei Da Vinci Architecture, дебютировавшей в Kirin 810 и 990. Современные реализации в Kirin 9000/9000S содержат несколько ядер NPU разного назначения: большие ядра (Big Core) для тяжелых моделей (например, генеративного ИИ), малые ядра (Tiny Core) для всегда активных задач (голосовое пробуждение, жесты) и средние ядра для баланса производительности и эффективности. Такая гетерогенность позволяет системе динамически распределять нагрузку, не разбуживая мощные ядра для простых операций.

История развития: от Cambricon к Da Vinci

Первый опыт внедрения выделенного ИИ-блока Huawei получила в 2017 году с Kirin 970. Тогда использовалась лицензионная архитектура Cambricon 1A, которая показала превосходство над GPU в 25 раз по производительности на ватт при распознавании изображений. С выходом Kirin 810 и 990 компания перешла на полностью собственную микроархитектуру Da Vinci, поддерживающую гибкую квантовку весов и структурную разреженность моделей. Это решение избавило от зависимости от сторонних IP-блоков и открыло путь к глубокой интеграции с компилятором HiAI DDK и фреймворком MindSpore Lite.

Ключевым этапом стало появление Kirin 9000 (2020), где NPU стал полноценным cidadão SoC с поддержкой FP16 и INT4, а также аппаратным ускорением операторов трансформеров. В последних чипах серии 9000S/9010/9020 акцент смещен на поддержку больших языковых моделей (LLM) на устройстве: увеличен локальный кэш, добавлены инструкции для механизма внимания (Attention) и оптимизирована шина памяти для стриминга весов модели из флеш-памяти. Это фундамент для функций Панели ИИ и ассистента Celia с генеративными возможностями в HarmonyOS NEXT.

  • 🧠 Kirin 970 (2017) — первый NPU на базе Cambricon 1A, ~1.9 TOPS INT8.
  • 🚀 Kirin 810/990 (2019) — переход на Da Vinci Architecture, поддержка FP16, ~10-15 TOPS.
  • ⚡ Kirin 9000/9000E (2020) — 2x Big + 1x Tiny Core, ~30 TOPS, поддержка INT4.
  • 🔮 Kirin 9000S/9010/9020 (2023-2026) — адаптация под LLM, увеличенный SRAM, оптимизация Attention.
⚠️ Внимание: На смартфонах с процессорами Qualcomm Snapdragon (выпущенные в 2021-2022 гг. из-за санкций) аппаратный NPU отсутствует или представлен блоком Hexagon DSP, который не совместим с экосистемой HiAI. Функции ИИ на таких устройствах работают за счет CPU/GPU и могут быть медленнее или недоступны.
📊 Какую задачу ИИ на смартфоне вы считаете самой полезной?
Умная фотография (распознавание сцен, ретушь)
Офлайн-перевод и транскрибация речи
Оптимизация батареи и производительности
Генеративный ИИ (текст, изображения) на устройстве

Какие задачи решает ИИ-модуль в реальной жизни

Пользователь редко взаимодействует с NPU напрямую — его работа скрыта внутри системных сервисов и приложений. Основной нагрузкой является компьютерное зрение: сегментация объектов в режиме просмотра галереи, супер-разрешение при цифровом зуме, удаление прохожих (AI Eraser) и HDR-сборка кадров в ночном режиме. Все эти операции выполняются за десятки миллисекунд благодаря конвейеризации операторов на NPU, в то время как CPU тратил бы секунды и разрядил бы батарею на 5-10% за сессию съемки.

Второй по весу сценарий — аудио- и речевая обработка. Шумоподавление при звонках, разделение голосов спикеров в диктофоне, офлайн-переводчик и голосовое управление Celia Tiny Core обрабатывает постоянно, не разбуживая большие ядра. Третий сценарий — системная оптимизация: предсказание запуска приложений (App Preloading), управление частотными профилями CPU/GPU под текущую задачу и интеллектуальное распределение памяти. В HarmonyOS NEXT к этому добавляется работа с эмбеддингами для семантического поиска по фото и документам.

☑️ Как понять, что NPU задействован в задаче

Выполнено: 0 / 4

Программный стек: HiAI, MindSpore Lite и доступ разработчикам

Аппаратная мощность бесполезна без инструментов для деплоя моделей. Huawei предоставляет экосистему HiAI Foundation, включающую драйверный уровень (DDK), компилятор моделей (Model Converter) и рантайм (HiAI Runtime). Разработчик конвертирует обученную модель (ONNX, TensorFlow, PyTorch) в формат .om (Offline Model) с квантовкой весов до INT8/FP16. Компилятор автоматически выполняет графовые оптимизации: слияние операторов (fusion), перестановку памяти (layout transform) и распределение операций по ядрам Big/Tiny.

Для кроссплатформенности и поддержки новых архитектур (трансформеры, диффузионные модели) акцентируется внимание на MindSpore Lite — легковесном фреймворке вывода, который абстрагирует железо и позволяет запускать одни и те же модели на NPU, GPU и CPU с автоматическим выбором лучшего бэкенда. В HarmonyOS NEXT появился высокоуровневый API ML Kit (аналог Core ML / ML Kit Google), дающий доступ к готовым пайплайнам: детекция лиц, поз, текста (OCR), классификация изображений — без необходимости таскать свои веса.

Компонент Назначение Поддерживаемые форматы
HiAI DDK Драйверы и компилятор для NPU ONNX, TF, PyTorch → .om
MindSpore Lite Рантайм вывода (Inference Engine) .om, .ms, FlatBuffer
ML Kit (HMS / HarmonyOS) Готовые высокоуровневые API Встроенные модели
HiAI Profiler Профилирование нагрузки на NPU Логи, трейсы, графики
⚠️ Внимание: Конвертация модели в .om требует ПК под Windows/Linux с установленным HiAI Toolkit. Прямо на телефоне скомпилировать модель под NPU нельзя — это кросскомпиляция. Без доступа к исходным весам модели (например, закрытый .om из системного приложения) переобучить или адаптировать её под свои данные невозможно.
Технические детали Da Vinci Architecture

Архитектура Da Vinci использует 3D Cube Computing Engine — матричный ускоритель 4096 MAC-блоков (16x16x16) на ядро Big Core. Поддерживает гибкую квантовку: веса INT4/INT8, активации FP16/INT8. Встроенный Vector Computing Engine обрабатывает поэлементные операции (Activation, Eltwise) без выноса данных в общую память. Tiny Core имеет урезанный Cube (256 MAC) и собственный локальный кэш 128 КБ для всегда-включенных задач.

Как проверить работу NPU на своем устройстве

Самый простой способ — установить приложение AI Benchmark или Geekbench ML из AppGallery (или APK с официальных сайтов). Запустите тест на выводе (Inference) и сравните результат NPU/Delegate с CPU. На флагманах 2020-2026 гг. разница в баллах составляет 10-50x в пользу NPU. Если тест показывает «NNAPI Delegation: None» или падает на CPU — значит, либо драйвер NPU не загружен, либо приложение не поддерживает HiAI NNAPI Delegate.

Для продвинутой диагностики разработчики используют HiAI Profiler (нужен ПК и ADB). Он показывает загрузку каждого ядра NPU, пропускную способность памяти и время выполнения каждого оператора графа. В меню разработчика HarmonyOS / EMUI есть пункт Настройки → Система и обновления → Для разработчиков → Мониторинг NPU (название может отличаться), включающий наложение с текущей утилизацией нейроблока в реальном времени. Это полезно, чтобы убедиться, что ваша кастомная модель действительно уходит на железо, а не выполняется программно.

💡

Если AI Benchmark не видит NPU, проверьте версию HiAI Foundation в настройках приложений (системные приложения → HiAI Foundation). Она должна быть актуальной (обычно 100.x.x или выше). Устаревший системный фреймворк — частая причина отсутствия делегирования на старых прошивках EMUI 10/11.

Различия между флагманскими и средними чипами

В линейке Kirin 9xx (флагманы) всегда присутствует полноценный кластер NPU: 2 Big Core + 1 Tiny Core. Это гарантирует поддержку самых тяжелых моделей — от сегментации 4K-видео в реальном времени до генерации изображений Stable Diffusion (с квантовкой INT4). В средней линейке Kirin 8xx (810, 820, 830, 8000) обычно оставляют 1 Big Core + 1 Tiny Core. Производительность на тяжелых задачах падает в 1.5-2 раза, но базовые сценарии (фото, голос, системная оптимизация) покрываются полностью.

Бюджетные чипы Kirin 710A / 710F и более старые не имеют выделенного NPU. Там ИИ-задачи выполняются на GPU (Mali) через OpenCL или на CPU через TFLite/XNNPACK. Это накладывает ограничения: нет офлайн-транскрибации длинных аудио, нет AI Eraser в галерее, нет умного предзагрузчика приложений. При покупке среднего бюджетника ориентируйтесь на наличие в спецификации строки «NPU: Да» или «Da Vinci Architecture» — маркетинг иногда называет «ИИ» обычный ISP обработки фото.

⚠️ Внимание: Наличие NPU в спецификации процессора не гарантирует, что все «фишки» ИИ будут доступны в конкретной модели телефона. Производитель может отключить функции программно (например, убрать AI Eraser из галереи на младших моделях серии Nova), чтобы разграничить линейки. Проверяйте обзоры конкретной модели перед покупкой.
💡

Главный вывод: NPU — это не маркетинговый чип, а реальный ускоритель, который делает возможными офлайн-функции ИИ, экономит батарею и снимает нагрузку с CPU. Без него современные сценарии (генеративный ИИ, семантический поиск, 4K-видео обработка) на телефоне невыполнимы.

Перспективы: генеративный ИИ на устройстве и HarmonyOS NEXT

С переходом на HarmonyOS NEXT и чипах серии Kirin 9010/9020 стратегия Huawei смещается от дискретных задач (классификация, детекция) к запуску базовых больших моделей (Foundation Models) прямо на смартфоне. Речь идет о LLM с 1-3 млрд параметров (квантовка INT4/INT3), которые умеют писать тексты, суммаризировать уведомления, генерировать ответы в мессенджерах и управлять системой на естественном языке. Для этого в NPU добавлена аппаратная поддержка операций FlashAttention, RMSNorm, RoPE и эффективное стриминговое чтение весов из UFS 4.0 в SRAM NPU без загрузки всей модели в DRAM.

Параллельно развивается мультимодальность: одна модель обрабатывает и текст, и изображение, и аудио (например, понимание экрана для голосового ассистента). Это требует единого пространства эмбеддингов и гибкого распределения вычислительных ресурсов между модальностями. Huawei решает это через MindSpore Lite Unified Runtime и системный сервис ModelBox, который управляет жизненным циклом моделей: загрузка, выгрузка, кэширование весов, динамическая квантовка под текущую нагрузку NPU. Пользователь получает «умный телефон» в прямом смысле — устройство, понимающее контекст без облака.

📊 Готовы ли вы платить за смартфон с мощным NPU для локального генеративного ИИ?
Да, это критично для приватности и скорости
Только если есть киллер-фича, которой нет в облаке
Нет, облачные решения (ChatGPT, ЯндексГПТ) меня устраивают
Сложно сказать, нужно попробовать на практике

Часто задаваемые вопросы (FAQ)

Можно ли обновить NPU или его драйверы отдельно от прошивки?

Нет, драйвер NPU (HiAI DDK) и прошивку микрокода нейропроцессора обновляет только полная системная OTA-прошивка. Отдельных модулей в AppGallery для этого не существует. Если производитель выпустил патч, улучшающий совместимость с новыми операторами — он придет с обновлением EMUI / HarmonyOS.

Почему в AI Benchmark мой телефон показывает низкий NPU Score, хотя процессор флагманский?

Возможные причины: устаревшая версия HiAI Foundation, тест не поддерживает новый формат моделей (например, INT4), перегрев — NPU сбрасывает частоты, или включен режим экономии энергии, ограничивающий нейроблок. Сбросьте кэш HiAI Foundation, охладите телефон и отключите энергосбережение перед тестом.

Работает ли NPU в приложениях не из AppGallery (например, установленных через APK)?

Да, если приложение использует стандартный Android NNAPI и в системе актуальный HiAI NNAPI Delegate. Большинство современных ML-приложений (фото-редакторы, сканеры, переводчики) делают именно так. Если приложение использует свой рантайм (например, MNN, NCNN, TFLite GPU Delegate) без поддержки HiAI Backend — NPU не задействуется.

Влияет ли загрузка NPU на нагрев и разряд батареи в обычной жизни?

Наоборот, разгрузка CPU на NPU снижает общий TDP. NPU выполняет работу за 1/10-1/50 энергии CPU. Однако интенсивная длительная нагрузка (например, генерация видео или час транскрибации) нагревает SoC локально в зоне NPU, что может вызвать троттлинг всего чипа. В обычных сценариях (фото, голос) нагрев незаметен.

Есть ли смысл покупать старый флагман (Mate 30 / P40) ради NPU в 2026-2026 году?

Для базовых задач (умная камера, офлайн-перевод, системная оптимизация) — да, Kirin 990 5G все еще очень способен. Но для новых функций HarmonyOS NEXT (генеративный ИИ, семантический поиск, большие модели) производительности и набора инструкций Kirin 990 недостаточно. Поддержка новых API ML Kit на старых чипах будет ограничена или отсутствовать.