Команда профессора Чжэн Вэймина из университета Цинхуа предложила гибридную схему построения ИИ‑инфраструктуры, которая позволяет сократить зависимость от импортных чипов без потери качества. Схема разделяет процесс генерации ответа на две стадии: обработку запроса (P) и генерацию ответа (D). Для каждой стадии используется разное оборудование: китайские чипы для P, импортные — для D.
В чём суть подхода
По словам Чжэн Вэймина, китайские чипы хорошо справляются с задачами обработки запросов, но отстают по параметрам памяти, критичным для генерации ответа. Поэтому команда предложила не пытаться закрыть весь цикл одним типом оборудования, а строить гибридную схему.
- Стадия P (processing) — обработка входного запроса, требует высокой вычислительной мощности.
- Стадия D (decoding) — генерация ответа токен за токеном, критична пропускная способность памяти и низкая задержка.
Сколько чипов нужно
По расчётам команды Цинхуа, из условных 10 тысяч карт девять тысяч могут быть китайскими, и лишь тысяча — импортными. При этом итоговый токен по качеству остаётся конкурентоспособным и продаётся по полной цене, а не по сниженной, как при использовании исключительно отечественного оборудования.
Какие нюансы есть у гибридной схемы
При работе с гибридной инфраструктурой важно учитывать два аспекта.
- Аппаратная гетерогенность: блоки P и D изначально запрашиваются как разные категории оборудования с разными техническими требованиями, а не как универсальный парк карт.
- Географическое разнесение: вычислительные узлы P и D могут находиться в разных городах, например в Пекине и Шанхае. Это позволяет экономить на электроэнергии: P размещают там, где электричество и охлаждение дешевле, а D — ближе к пользователям.
Вместо того чтобы гнаться за паритетом по числу топовых чипов, команда решила оптимизировать архитектуру под фактически доступное оборудование и добиться сопоставимого качества сервиса за счёт распределения нагрузки и топологии сети. При ограниченном доступе к картам, отметил Чжэн Вэймин, каждый процент прироста эффективности от такой оптимизации стоит на порядок больше, чем при неограниченных закупках. Этот подход перекликается с позицией Huawei, которая также делает ставку на интеллектуальные решения, а не на масштаб.