Команда профессора Чжэн Вэймина из университета Цинхуа предложила гибридную схему построения ИИ‑инфраструктуры, которая позволяет сократить зависимость от импортных чипов без потери качества. Схема разделяет процесс генерации ответа на две стадии: обработку запроса (P) и генерацию ответа (D). Для каждой стадии используется разное оборудование: китайские чипы для P, импортные — для D.

В чём суть подхода

По словам Чжэн Вэймина, китайские чипы хорошо справляются с задачами обработки запросов, но отстают по параметрам памяти, критичным для генерации ответа. Поэтому команда предложила не пытаться закрыть весь цикл одним типом оборудования, а строить гибридную схему.

  • Стадия P (processing) — обработка входного запроса, требует высокой вычислительной мощности.
  • Стадия D (decoding) — генерация ответа токен за токеном, критична пропускная способность памяти и низкая задержка.

Сколько чипов нужно

По расчётам команды Цинхуа, из условных 10 тысяч карт девять тысяч могут быть китайскими, и лишь тысяча — импортными. При этом итоговый токен по качеству остаётся конкурентоспособным и продаётся по полной цене, а не по сниженной, как при использовании исключительно отечественного оборудования.

Какие нюансы есть у гибридной схемы

При работе с гибридной инфраструктурой важно учитывать два аспекта.

  • Аппаратная гетерогенность: блоки P и D изначально запрашиваются как разные категории оборудования с разными техническими требованиями, а не как универсальный парк карт.
  • Географическое разнесение: вычислительные узлы P и D могут находиться в разных городах, например в Пекине и Шанхае. Это позволяет экономить на электроэнергии: P размещают там, где электричество и охлаждение дешевле, а D — ближе к пользователям.

Вместо того чтобы гнаться за паритетом по числу топовых чипов, команда решила оптимизировать архитектуру под фактически доступное оборудование и добиться сопоставимого качества сервиса за счёт распределения нагрузки и топологии сети. При ограниченном доступе к картам, отметил Чжэн Вэймин, каждый процент прироста эффективности от такой оптимизации стоит на порядок больше, чем при неограниченных закупках. Этот подход перекликается с позицией Huawei, которая также делает ставку на интеллектуальные решения, а не на масштаб.