ce model detecte un objet sur une image ou une video
description d'une image
traduit le texte en audio
traducteur de texte