[ Portfolio ]Wadjid Assani

[ Backend Engineer → Data & AI ]

data..

Tous les articles
IA14 juil. 202610 min de lecture

Construire un pipeline d'analyse de CV avec des embeddings

Un parser de CV, ça parse mal. PDF multi-colonnes, DOCX exotiques, scans... Voici comment construire un pipeline qui tient la route, de l'extraction jusqu'au score final.

01Extraire avant de comprendre

Première leçon : la qualité du score dépend à 80% de la qualité de l'extraction. On normalise d'abord (encodage, colonnes PDF, listes à puces) avant de découper en sections : identité, expériences, formations, compétences.

02Embeddings et similarité cosinus

Chaque section est vectorisée avec un modèle sentence-transformers. Le score final combine similarité des expériences (poids fort), des compétences (exacte + sémantique) et de la formation. Les pondérations sont configurables par offre.

Le piège classique : comparer le CV entier à l'offre entière. Découper d'abord, comparer ensuite — la précision passe de ~70% à ~94% sur notre dataset de test.

#Python#FastAPI#Embeddings#NLP

Une question sur cet article ?

Me contacter
Wadjid Assani
wadjidassani@gmail.com

Quels services pour votre projet ?

Je suis intéressé par :

Télécharger le CV