Apprendi le caratteristiche strutturali dai dati che sono significativi per la classificazione
Descrivere le informazioni strutturali nell'immagine di input
I risultati della descrizione vengono archiviati in 256 mappe di risposta delle funzionalità 6x6
ZLNet
Stessa struttura di AlexNet
Migliorare
Cambia il kernel di convoluzione precedente in una dimensione più piccola
Aumenta la dimensione del passo per estrarre correttamente le funzionalità
Aumentare il numero di kernel a convoluzione tardiva
VGG
Rete neurale a 16 strati
13 strati convoluzionali
3 strati completamente connessi
Migliorare
Utilizzare kernel di convoluzione 3x3 più piccoli in serie per ottenere un campo ricettivo più ampio
Maggiore profondità, maggiore non linearità e meno parametri di rete
Rimuovere il livello LRN di AlexNet
Riassumere
Vantaggi del kernel a piccola convoluzione
Più kernel di convoluzione di piccole dimensioni collegati in serie possono ottenere lo stesso campo ricettivo dei kernel di convoluzione di grandi dimensioni e richiedono meno parametri di addestramento.
Motivi della convoluzione a 512
Ci sono molti parametri per raccogliere ed esprimere il più possibile le funzionalità
Se ci sono troppi parametri, sarà facile sovraadattarlo e non è adatto all'allenamento.
GoogleNet
22esimo piano
Innovazione
Proporre la struttura di inizio, che può conservare più informazioni caratteristiche del segnale di ingresso
Aggiungi un livello di collo di bottiglia e modifica il numero di canali di convoluzione
Rimuovi il livello completamente connesso e utilizza il pooling medio, ottenendo solo 5 milioni di parametri, 12 volte meno di AlexNet.
Un classificatore ausiliario viene introdotto al centro della rete per superare il problema del gradiente evanescente durante l'addestramento.
Riassumere
La differenza tra la vettorizzazione del pooling medio e la vettorizzazione dell'espansione diretta
Il valore di ciascuna posizione sulla mappa di risposta delle caratteristiche riflette la somiglianza tra la struttura della posizione corrispondente nell'immagine e la struttura semantica registrata dal kernel di convoluzione.
Il pooling medio perde le informazioni sulla posizione spaziale delle strutture semantiche
Ignorare le informazioni sulla posizione della struttura semantica aiuta a migliorare l'invarianza traslazionale delle caratteristiche estratte dallo strato convoluzionale.
resnet
Approfondire gli strati di rete
Le reti più profonde sembrano essere inferiori alle reti meno profonde
motivo
Durante il processo di formazione, le informazioni positive e negative della rete non fluiscono in modo fluido e la rete non è completamente addestrata.
innovazione
Modulo residuo proposto
Impilando moduli residui, è possibile costruire reti neurali di profondità arbitraria senza "degrado".
proposta di normalizzazione batch
Combatti la scomparsa del gradiente e riduci la dipendenza dall'inizializzazione del peso durante l'allenamento in rete.
Proporre un metodo di inizializzazione per la funzione di attivazione ReLU