
Anatomie d'un modèle : ce que contient un fichier de poids
Un LLM open-source, c'est un dossier de sept fichiers. Anatomie du safetensors de Gemma 4 12B en production : poids, tenseurs, architecture, embeddings.

Les dimensions d'un LLM : embedding, couches, attention
Embedding, vocabulaire, couches, paramètres : ce que chaque dimension de Gemma 4 12B mesure vraiment, et ce qui se passe à l'intérieur d'une couche.

Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)
Le débit d'un LLM en génération est limité par la bande passante mémoire du GPU, pas par sa puissance de calcul. Démonstration chiffrée sur Gemma 4 12B.