github.com via Hacker News

Show HN : un LLM de 28,9 M de paramètres tourne sur un microcontrôleur ESP32-S3 à 8 $ à 9,5 tokens/s

Résumé

Un projet publié sur GitHub fait tourner un modèle de langage de 28,9 M de paramètres sur un ESP32-S3 (8 $, 512KB SRAM et 8MB PSRAM) à environ 9,5 tokens/seconde. L'astuce : les Per-Layer Embeddings, qui gardent la table d'embedding de 25 M de paramètres en flash lente pendant que seuls les blocs de calcul restent en SRAM rapide. Le modèle, entraîné sur TinyStories, sait générer de courts récits mais ne répond pas aux questions.

Shared on Bluesky by 1 AI expert