Raspberry Pi 5 получил LiteRT для локального ИИ на CPU и GPU
Raspberry Pi и Google оптимизировали LiteRT для запуска локального ИИ на Raspberry Pi 5. Платформа поддерживает Gemma, YOLO, MediaPipe и модели распознавания речи и умеет распределять вычисления между CPU и встроенным GPU.
Gemma 4 E2B теперь можно запустить на обычном Raspberry Pi 5 с 8 ГБ RAM без отдельного AI-ускорителя. В тесте Raspberry Pi модель через LiteRT-LM показала 99 токенов/с на этапе prefill и около 9 токенов/с при генерации, используя примерно 1432 МБ памяти.
Для сравнения, llama.cpp в том же тесте потребовал около 4406 МБ.
Хороший пример – робот Reachy Mini.
В демонстрации вычисления разделены параллельно:
- YOLO постоянно анализирует изображение;
- Moonshine распознаёт речь;
- Gemma 4 E2B принимает текст и информацию от камеры;
- модель определяет действие робота;
- локальный TTS превращает ответ в голос.
Вся цепочка работает на одном Raspberry Pi 5 без облака.
Начать можно с установки LiteRT CLI:
pip install litert-cli
После этого модели из LiteRT Community на Hugging Face можно запускать непосредственно через CLI.
Сам инструмент интересен не только запуском LLM. LiteRT объединяет в одном наборе команд четыре стадии работы:
- конвертацию модели;
- квантование;
- benchmark;
- inference.
Размер тоже заметно отличается от типичных серверных инструментов. LiteRT CLI с поддержкой LLM загружает около 25 МБ, тогда как в сравнении Raspberry Pi установка Ollama занимает примерно 1,44 ГБ.
Для встроенных устройств это уже существенная разница.
Raspberry Pi 5 также получил GPU inference через WebGPU/Vulkan и VideoCore VII. Поддерживаются MediaPipe, YOLO, EfficientNet, Moonshine и другие модели.
Raspberry Pi опубликовала тесты и готовый пример с Reachy Mini, включая исходный код полного конвейера зрения, речи и Gemma.
Следующий шаг уже заявлен: LiteRT и Gemma планируют перенести на ускорители Hailo AI HAT+ и AI HAT+ 2. Тогда тот же программный workflow сможет использовать отдельный NPU вместо CPU.
Таким образом Raspberry Pi 5 постепенно превращается из платы, на которой можно экспериментировать с ИИ, в полноценную платформу для автономных камер, голосовых интерфейсов и небольших роботов, работающих полностью локально.



Комментарии (0)