Construire un pipeline d'analyse de CV avec des embeddings
Un parser de CV, ça parse mal. PDF multi-colonnes, DOCX exotiques, scans... Voici comment construire un pipeline qui tient la route, de l'extraction jusqu'au score final.
01Extraire avant de comprendre
Première leçon : la qualité du score dépend à 80% de la qualité de l'extraction. On normalise d'abord (encodage, colonnes PDF, listes à puces) avant de découper en sections : identité, expériences, formations, compétences.
02Embeddings et similarité cosinus
Chaque section est vectorisée avec un modèle sentence-transformers. Le score final combine similarité des expériences (poids fort), des compétences (exacte + sémantique) et de la formation. Les pondérations sont configurables par offre.
Le piège classique : comparer le CV entier à l'offre entière. Découper d'abord, comparer ensuite — la précision passe de ~70% à ~94% sur notre dataset de test.
Une question sur cet article ?
Me contacter ↗
