· 7 min

Anatomie d'un modèle : ce que contient un fichier de poids

Un LLM open-source, c'est un dossier de sept fichiers. Anatomie du safetensors de Gemma 4 12B qui tourne en production : poids, tenseurs, architecture, embeddings. Ce que le fichier contient, et ce qu'il ne contient pas.

· 7 min

Les dimensions d'un LLM : embedding, couches, attention

"Dimension" désigne au moins quatre choses différentes dans un LLM. Embedding, vocabulaire, couches, paramètres : ce que chaque chiffre de Gemma 4 12B mesure vraiment, et ce qui se passe à l'intérieur d'une couche.

· 8 min

Pourquoi l'inférence LLM est memory-bound (et ce que ça change pour le sizing)

Le débit d'un LLM en génération n'est pas limité par la puissance de calcul du GPU mais par sa bande passante mémoire. La démonstration chiffrée sur Gemma 4 12B, et pourquoi ça dicte le choix de la carte.

· 9 min

Déployer un LLM on-premise : les décisions d'architecture qui comptent

Entre "faire tourner Ollama en local" et déployer une stack IA fiable en production, il y a une série de décisions d'architecture. Moteur d'inférence, interface, automation, sizing : ce qui compte vraiment.

· 6 min

PHP-FPM & Kubernetes : arrêtez de mal configurer votre process manager

La configuration PHP-FPM est souvent copiée sans être comprise, ce qui provoque des OOMKill en production. pm=static couplé au HPA Kubernetes est la bonne approche pour le PHP conteneurisé.

· 7 min

Crossplane : éviter les pièges et les suppressions accidentelles

deletionPolicy, managementPolicies, versionnage des providers : les trois paramètres Crossplane à configurer pour éviter de supprimer votre base de production.

· 8 min

Comment on a simplifié notre stack IA avec LiteLLM chez Evaneos

Comment Evaneos a remplacé des clés API éparpillées entre OpenAI, Anthropic, Gemini et Deepgram par un proxy LiteLLM unique déployé sur Kubernetes avec FluxCD.

· 5 min

Crossplane : l'outil parfait pour construire son PaaS interne ?

Et si les développeurs pouvaient provisionner de l'infrastructure comme ils écrivent des APIs ? Crossplane transforme votre cluster Kubernetes en plan de contrôle pour bâtir un vrai PaaS interne.

· 4 min

Sauvegarder des bases Postgres avec Google Cloud Run

Une application Python Flask légère qui tourne sur Cloud Run pour exécuter des dumps PostgreSQL et les stocker dans GCS, déclenchée par Cloud Scheduler, sans infrastructure always-on.