Vision Transformers — DINOv2 & SigLIP 2

DINOv2 SigLIP 2 Kaggle Dual T4 GPU

Estudo prático dos Vision Transformers mais recentes — DINOv2 e SigLIP 2 — implementados em notebooks Kaggle rodando em dual T4, cobrindo as duas grandes famílias de pré-treinamento visual da atualidade.

Abordagem

O DINOv2 representa o self-supervised learning: aprender representações visuais robustas sem rótulos. O SigLIP 2 representa a via contrastiva imagem-texto, com a função de perda sigmoide que dispensa batches gigantes. Implementar os dois lado a lado permite comparar na prática como cada paradigma se comporta em extração de features e transfer learning.

Os notebooks exploram o uso de duas GPUs T4 no Kaggle — distribuição de carga e gerenciamento de memória para modelos que não cabem confortavelmente em uma única GPU gratuita.

Stack

  • DINOv2 — features visuais self-supervised
  • SigLIP 2 — visão-linguagem com perda sigmoide
  • Kaggle + dual T4 — ambiente de experimentação com multi-GPU

Quer conversar sobre este projeto ou construir algo parecido?

Entrar em contato