>_DamDevOps
Accueil Blog GitHub LinkedIn

Blog

Tous (9) Crossplane (2) GCP (1) IA (5) IaC (1) Kubernetes (4) LLM (3) PHP (1) PostgreSQL (1) Python (1) vLLM (2)
Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)
5 juillet 2026 · 8 min

Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)

Le débit d'un LLM en génération n'est pas limité par la puissance de calcul du GPU mais par sa bande passante mémoire. La démonstration chiffrée sur Gemma 4 12B, et pourquoi ça dicte le choix de la carte.

IA LLM vLLM
Lire →
Déployer un LLM on-premise : les décisions d'architecture qui comptent
9 juin 2026 · 9 min

Déployer un LLM on-premise : les décisions d'architecture qui comptent

Entre "faire tourner Ollama en local" et déployer une stack IA fiable en production, il y a une série de décisions d'architecture. Moteur d'inférence, interface, automation, sizing : ce qui compte vraiment.

IA Kubernetes vLLM
Lire →

© 2026 Damien Dagorn · GitHub · LinkedIn