Projet personnel
EduVision — Deep Learning Image Captioning
PyTorchResNet-50TransformerBeam SearchFlaskReact




DRAG · ← → · CLICK AN IMAGE
Architecture encodeur-décodeur : un CNN ResNet-50 pré-entraîné extrait les caractéristiques visuelles de l'image, un décodeur Transformer génère ensuite la légende mot à mot.
Décodage par beam search plutôt que glouton : le modèle explore plusieurs séquences candidates en parallèle et retient la plus probable, ce qui améliore nettement la qualité des légendes et le score BLEU.
Servi par une API Flask et consommé par une interface React permettant d'uploader une image et d'obtenir sa description générée.