>_DamDevOps
Accueil Blog GitHub LinkedIn

Blog

Tous (9) Crossplane (2) GCP (1) IA (5) IaC (1) Kubernetes (4) LLM (3) PHP (1) PostgreSQL (1) Python (1) vLLM (2)
Anatomie d'un modèle : ce que contient un fichier de poids
19 juillet 2026 · 7 min

Anatomie d'un modèle : ce que contient un fichier de poids

Un LLM open-source, c'est un dossier de sept fichiers. Anatomie du safetensors de Gemma 4 12B en production : poids, tenseurs, architecture, embeddings.

IA LLM
Lire →
Les dimensions d'un LLM : embedding, couches, attention
12 juillet 2026 · 7 min

Les dimensions d'un LLM : embedding, couches, attention

Embedding, vocabulaire, couches, paramètres : ce que chaque dimension de Gemma 4 12B mesure vraiment, et ce qui se passe à l'intérieur d'une couche.

IA LLM
Lire →
Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)
5 juillet 2026 · 8 min

Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)

Le débit d'un LLM en génération est limité par la bande passante mémoire du GPU, pas par sa puissance de calcul. Démonstration chiffrée sur Gemma 4 12B.

IA LLM vLLM
Lire →
Déployer un LLM on-premise : les décisions d'architecture qui comptent
9 juin 2026 · 9 min

Déployer un LLM on-premise : les décisions d'architecture qui comptent

Déployer une stack IA fiable en production ne se résume pas à lancer Ollama en local. Moteur d'inférence, interface, automation et sizing : ce qui compte.

IA Kubernetes vLLM
Lire →
Comment on a simplifié notre stack IA avec LiteLLM chez Evaneos
9 décembre 2025 · 8 min

Comment on a simplifié notre stack IA avec LiteLLM chez Evaneos

Comment Evaneos a remplacé des clés API éparpillées entre OpenAI, Anthropic, Gemini et Deepgram par un proxy LiteLLM unique déployé sur Kubernetes avec FluxCD.

IA Kubernetes
Lire →

© 2026 Damien Dagorn · GitHub · LinkedIn