
Anatomie d'un modèle : ce que contient un fichier de poids
Un LLM open-source, c'est un dossier de sept fichiers. Anatomie du safetensors de Gemma 4 12B en production : poids, tenseurs, architecture, embeddings.

Les dimensions d'un LLM : embedding, couches, attention
Embedding, vocabulaire, couches, paramètres : ce que chaque dimension de Gemma 4 12B mesure vraiment, et ce qui se passe à l'intérieur d'une couche.

Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)
Le débit d'un LLM en génération est limité par la bande passante mémoire du GPU, pas par sa puissance de calcul. Démonstration chiffrée sur Gemma 4 12B.

Déployer un LLM on-premise : les décisions d'architecture qui comptent
Déployer une stack IA fiable en production ne se résume pas à lancer Ollama en local. Moteur d'inférence, interface, automation et sizing : ce qui compte.

PHP-FPM & Kubernetes : arrêtez de mal configurer votre process manager
La configuration PHP-FPM est souvent copiée sans être comprise, d'où des OOMKill en production. pm=static couplé au HPA Kubernetes est la bonne approche.

Crossplane : éviter les pièges et les suppressions accidentelles
deletionPolicy, managementPolicies, versionnage des providers : les trois paramètres Crossplane à configurer pour éviter de supprimer votre base de production.

Comment on a simplifié notre stack IA avec LiteLLM chez Evaneos
Comment Evaneos a remplacé des clés API éparpillées entre OpenAI, Anthropic, Gemini et Deepgram par un proxy LiteLLM unique déployé sur Kubernetes avec FluxCD.

Crossplane : l'outil parfait pour construire son PaaS interne ?
Et si les développeurs provisionnaient l'infrastructure comme ils écrivent des APIs ? Crossplane transforme Kubernetes en plan de contrôle pour un PaaS interne.

Sauvegarder des bases Postgres avec Google Cloud Run
Application Python Flask sur Cloud Run qui exécute des dumps PostgreSQL et les stocke dans GCS, déclenchée par Cloud Scheduler, sans infrastructure always-on.