Projet personnel

EduVision — Deep Learning Image Captioning

PyTorchResNet-50TransformerBeam SearchFlaskReact
Interface de génération de légende
Interface de génération de légende
Architecture du modèle
Architecture du modèle
Entraînement et métriques
Entraînement et métriques
Exemples de résultats
Exemples de résultats

DRAG · ← → · CLICK AN IMAGE

Architecture encodeur-décodeur : un CNN ResNet-50 pré-entraîné extrait les caractéristiques visuelles de l'image, un décodeur Transformer génère ensuite la légende mot à mot.

Décodage par beam search plutôt que glouton : le modèle explore plusieurs séquences candidates en parallèle et retient la plus probable, ce qui améliore nettement la qualité des légendes et le score BLEU.

Servi par une API Flask et consommé par une interface React permettant d'uploader une image et d'obtenir sa description générée.