Modellazione del linguaggio maschera (MCM): alcune parole o marcatori nella sequenza di input vengono sostituiti con marcatori di maschera speciali, quindi è necessario il modello pre -pre -pre -pre -marcatori in base al contesto multimodale visibile.
Modellazione di immagini di maschera (MIM): alcune aree nell'immagine di input sono nascoste o sostituite con marchi di maschera speciali, quindi è necessario il modello pre-addestrato per prevedere o ripristinare l'area dell'immagine mascherata se vengono visualizzati solo il contenuto di immagine rimanente e altre informazioni modali come il testo.
Image-Text Match (ITM): implementare l'allineamento globale di immagini e testo. Di solito, una determinata coppia di immagini e testo viene utilizzata come campione positivo, quindi accoppiarlo come campione negativo, quindi la corrispondenza dell'immagine e del testo viene ottenuta attraverso un metodo di classificazione binaria, stabilendo così una relazione semantica tra l'immagine e il testo.
Image-Text Confronto Learning (ITC): utilizzare il metodo di apprendimento del contrasto per avviare rappresentazioni vettoriali più vicine delle stesse coppie di campioni di immagini e testo e spingere più diverse coppie di campioni di rappresentazioni vettoriali, migliorando così la correlazione semantica tra immagini e testo.