# Optimisation RAG Interne

> Comment CiteMe ingère et traite le contenu de votre site web pour optimiser votre visibilité IA.

Technique

Le RAG (Retrieval Augmented Generation) est le mécanisme par lequel les LLM enrichissent leurs connaissances en temps réel. Quand Perplexity ou le mode browsing de ChatGPT répondent à une question, ils ne se fient pas uniquement à leurs données d'entraînement : ils recherchent activement du contenu web pertinent, l'ingèrent, et l'utilisent comme base pour générer leur réponse.

Comprendre comment fonctionne ce processus d'ingestion et optimiser votre site pour être **facilement et fidèlement ingéré** est un levier GEO majeur. CiteMe lit votre site de la même manière pour connaître votre contenu.

---

## Comment CiteMe lit votre site

### 1. Découverte et lecture des pages

Le robot de CiteMe s'identifie avec le User-Agent `CiteMe Bot/1.0`. Il cherche votre sitemap dans `robots.txt`, puis à `/sitemap.xml` et `/sitemap_index.xml`, et suit les liens de la page d'accueil si aucun sitemap n'existe. Le nombre de pages lues dépend de votre forfait. Le texte de chaque page est extrait de son HTML.

### 2. Découpage

Le texte est découpé en passages d'environ **1 000 caractères**, qui se chevauchent de 200 caractères pour qu'une idée coupée en deux reste lisible dans l'un des deux passages.

### 3. Vectorisation

Chaque passage est converti en un vecteur de 1 536 dimensions avec le modèle `text-embedding-3-small` d'OpenAI, puis stocké dans l'index vectoriel du projet. CiteMe s'en sert notamment pour suggérer des prompts proches de votre offre.

---

## Optimiser votre "Ingestibilité"

### Crawlabilité

Votre site doit être **facilement et complètement crawlable** par les robots IA. Les points de vérification essentiels :

- **Sitemap à jour** — CiteMe utilise votre `sitemap.xml` comme source principale de découverte. Assurez-vous qu'il est complet, à jour, et inclut les dates de dernière modification
- **Robots.txt** — Autorisez les robots des moteurs IA (`GPTBot`, `OAI-SearchBot`, `ClaudeBot`, `PerplexityBot`, `Google-Extended`) dans votre fichier robots.txt. Le robot de CiteMe s'identifie avec le User-Agent `CiteMe Bot/1.0`
- **Temps de réponse** — Un site lent ralentit le crawl. Visez un temps de réponse inférieur à 500ms par page
- **Pas de contenu bloqué** — Évitez le contenu chargé exclusivement via JavaScript client-side (SPA sans SSR), qui est invisible pour la plupart des crawlers IA

### Enrichissement des métadonnées

Les données structurées jouent un rôle crucial dans l'interprétabilité de votre contenu par les systèmes RAG :

- **Schema.org / JSON-LD** — Implémentez les schémas pertinents pour vos types de contenu (Product, Article, FAQ, HowTo, Organization, Review)
- **Open Graph et meta descriptions** — Fournissent un résumé structuré de chaque page qui aide les systèmes RAG à contextualiser le chunk
- **Breadcrumbs structurées** — Aident les crawlers à comprendre la hiérarchie de votre contenu
- **Données tabulaires** — Les tableaux HTML bien structurés sont particulièrement bien extraits par les systèmes RAG

---

## Cycle de mise à jour de l'index

| Paramètre | Valeur |
|-----------|--------|
| **Fréquence par défaut** | Synchronisation hebdomadaire automatique de votre index vectoriel |
| **Synchronisation manuelle** | Disponible à tout moment si vous publiez du contenu fréquemment |
| **Temps de ré-indexation** | 5 à 30 minutes selon la taille du site |
| **Notification** | Email automatique à la fin de chaque ré-indexation |

Nous recommandons de déclencher une synchronisation manuelle après chaque publication de contenu important, afin que votre prochain audit prenne en compte les dernières modifications.

---

## Confidentialité et Sécurité des données

:::note Données strictement privées
Votre index vectoriel est rattaché à votre projet. Il n'est pas partagé avec les autres utilisateurs de CiteMe et sert uniquement aux fonctionnalités de votre projet, comme la suggestion de prompts.
:::

**[GEO Score →](../plateforme/geo-score)**
