Estudo prático dos Vision Transformers mais recentes — DINOv2 e SigLIP 2 — implementados em notebooks Kaggle rodando em dual T4, cobrindo as duas grandes famílias de pré-treinamento visual da atualidade.
Abordagem
O DINOv2 representa o self-supervised learning: aprender representações visuais robustas sem rótulos. O SigLIP 2 representa a via contrastiva imagem-texto, com a função de perda sigmoide que dispensa batches gigantes. Implementar os dois lado a lado permite comparar na prática como cada paradigma se comporta em extração de features e transfer learning.
Os notebooks exploram o uso de duas GPUs T4 no Kaggle — distribuição de carga e gerenciamento de memória para modelos que não cabem confortavelmente em uma única GPU gratuita.
Stack
- DINOv2 — features visuais self-supervised
- SigLIP 2 — visão-linguagem com perda sigmoide
- Kaggle + dual T4 — ambiente de experimentação com multi-GPU