>_DamDevOps
Accueil Blog GitHub LinkedIn

Blog

Tous (9) Crossplane (2) GCP (1) IA (5) IaC (1) Kubernetes (4) LLM (3) PHP (1) PostgreSQL (1) Python (1) vLLM (2)
Anatomie d'un modèle : ce que contient un fichier de poids
19 juillet 2026 · 7 min

Anatomie d'un modèle : ce que contient un fichier de poids

Un LLM open-source, c'est un dossier de sept fichiers. Anatomie du safetensors de Gemma 4 12B qui tourne en production : poids, tenseurs, architecture, embeddings. Ce que le fichier contient, et ce qu'il ne contient pas.

IA LLM
Lire →
Les dimensions d'un LLM : embedding, couches, attention
12 juillet 2026 · 7 min

Les dimensions d'un LLM : embedding, couches, attention

"Dimension" désigne au moins quatre choses différentes dans un LLM. Embedding, vocabulaire, couches, paramètres : ce que chaque chiffre de Gemma 4 12B mesure vraiment, et ce qui se passe à l'intérieur d'une couche.

IA LLM
Lire →
Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)
5 juillet 2026 · 8 min

Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)

Le débit d'un LLM en génération n'est pas limité par la puissance de calcul du GPU mais par sa bande passante mémoire. La démonstration chiffrée sur Gemma 4 12B, et pourquoi ça dicte le choix de la carte.

IA LLM vLLM
Lire →

© 2026 Damien Dagorn · GitHub · LinkedIn