Show HN : un LLM de 28,9 M de paramètres tourne sur un microcontrôleur ESP32-S3 à 8 $ à 9,5 tokens/s
Résumé
Un projet publié sur GitHub fait tourner un modèle de langage de 28,9 M de paramètres sur un ESP32-S3 (8 $, 512KB SRAM et 8MB PSRAM) à environ 9,5 tokens/seconde. L'astuce : les Per-Layer Embeddings, qui gardent la table d'embedding de 25 M de paramètres en flash lente pendant que seuls les blocs de calcul restent en SRAM rapide. Le modèle, entraîné sur TinyStories, sait générer de courts récits mais ne répond pas aux questions.
Shared on Bluesky by 1 AI expert
Article original publié par github.com
Lire l'article original →Titre original : Show HN : un LLM de 28,9 M de paramètres tourne sur un microcontrôleur ESP32-S3 à 8 $ à 9,5 tokens/s