Compression intelligente · native TokenSaver

Vos agents lisent moins, et comprennent mieux.

TokenSaver compresse automatiquement tout ce qu'un agent IA lit — résultats d'outils, logs, JSON, RAG, historique — avant l'envoi au LLM. La bonne stratégie, pour le bon type de contenu, sans perdre l'information critique.

Jusqu'à -90% tokensRéversible (CCR)Multi-format natifSans service tiers
Le problème

Les agents IA lisent trop, et paient pour du bruit.

Une compression « one size fits all » ne suffit pas : un tableau JSON de 10 000 lignes ne se traite pas comme un log CI ou un extrait de documentation.

Coûts LLM qui explosent

Chaque appel d'outil, chaque log, chaque doc RAG gonfle la facture — souvent sans valeur ajoutée pour le modèle.

Latence dégradée

Plus de tokens en entrée = plus de temps avant la première réponse et une fenêtre de contexte saturée.

Signal noyé dans le bruit

Un FATAL enfoui ligne 6 742 dans 10 000 lignes de log a peu de chances d'être vu par le modèle.

Comment ça marche

Trois étapes, intégrées au pipeline.

01

Détection

TokenSaver identifie le type de contenu de chaque bloc de contexte : JSON, logs, texte, RAG, code, diff Git…

02

Routage

Une stratégie dédiée compresse ce bloc de façon ciblée — préservant structure, signaux d'erreur et tokens critiques.

03

Injection

Seul l'essentiel part au LLM. Le contenu original est stocké côté session — récupérable à la demande si l'agent en a besoin.

Position dans le pipeline TokenSaver
CacheRAGCompressionPIILLMMétriques
Un compresseur par type de contenu

Chaque type de contenu a sa stratégie.

Chiffres indicatifs, inspirés des benchmarks du marché. Les gains réels dépendent du contenu et de la policy.

Tableaux JSON (API, BDD, outils)
Garde schéma, anomalies, erreurs et un échantillon représentatif
70–90%
Logs & tests
Conserve erreurs, warnings et contexte autour ; supprime le bruit « PASS »
80–95%
RAG / recherche documentaire
Filtre par pertinence, respecte le budget tokens, garde les meilleurs passages
40–70%
Texte brut
Réduction du contenu redondant, extraction des phrases clés
30–50%
Code source
Préserve signatures, imports et structure ; compresse le corps
40–70%
Diffs Git
Garde les hunks modifiés, retire le contexte inchangé
40–60%
CCR

Compression agressive,
rien n'est perdu.

Le contenu original est stocké de façon sécurisée dans votre session ou workspace. Le LLM reçoit un résumé compact avec une référence — et peut récupérer le détail à la demande via l'outil tokensaver_retrieve_context.

→ Vous pouvez compresser fort sans craindre de perdre une erreur critique enfouie à la ligne 4 672.

Exemple concret
Sans TokenSaver
10 000+ tokens envoyés · coût élevé · erreur FATAL noyée
Avec TokenSaver
~1 200 tokens · FATAL conservée automatiquement · -88%
Bénéfices

Un levier direct sur coûts, qualité et gouvernance.

Coût

Moins de tokens = facture LLM réduite, sur chaque appel.

Latence

Prompts plus courts = réponses plus rapides pour vos utilisateurs.

Qualité

Moins de bruit = le modèle se concentre sur l'utile.

Gouvernance

Policies par clé API, traçabilité avant/après, ratio et stratégie utilisée.

Sécurité

PII appliqué après compression ; pas de fuite cross-workspace sur le retrieve.

Souveraineté

Logique hébergée chez TokenSaver — aucune dépendance à un service tiers.

Intégration

Partout où passe une requête IA.

Chat / API pipeline

POST /pipelines/run, API OpenAI-compatible : la compression s'applique à chaque appel.

Proxy egress

Cursor, Claude Code, n8n : vos clients existants passent par TokenSaver sans changer de code.

MCP Gateway

Agents multi-tours et sessions longues : la compression garde les fenêtres de contexte sous contrôle.

Voyez ce que TokenSaver compresse dans votre trafic.

En 30 minutes, on branche un échantillon représentatif et on vous montre les gains — par type de contenu, par workflow, par équipe.