Будущее ИИ-чипов: OpenAI, FPGA и аппаратная реализация LLM
Ключевые факты
- 1 OpenAI исследует кастомные ИИ-чипы для инференса.
- 2 FPGA используются для запуска небольших языковых моделей.
- 3 Заявление о чипе TAALAS для Llama 3.1 8B с высокой производительностью не подтверждено.
- 4 Развиваются локальные ИИ-модели (Apple) и децентрализованный инференс.
В посте рассматриваются ключевые направления развития аппаратного обеспечения для искусственного интеллекта. Упоминаются планы OpenAI по разработке собственных кастомных чипов, которые, предположительно, будут более эффективны для инференса по сравнению с решениями NVIDIA. Производство этих чипов приписывается TSMC, а проектирование — Broadcom. Также затрагивается тема использования FPGA (Field-Programmable Gate Array) для запуска небольших языковых моделей, таких как microGPT. FPGA позволяют перепрограммировать логику работы, что может обеспечить высокую скорость обработки данных, если алгоритм полностью реализован в аппаратной логике. Наиболее амбициозное заявление касается компании TAALAS, которая якобы разработала чип, аппаратно реализующий модель Llama 3.1 8B. Утверждается, что этот чип достигает производительности в 16 000 токенов в секунду, значительно превосходя Nvidia B200, которая, по данным поста, выдает 353 токена в секунду на пользователя для той же модели. В заключение, пост упоминает развитие специализированных локальных моделей для компьютеров и телефонов (с акцентом на Apple) и движение за децентрализованный инференс, аналогичное криптовалютным сетям.