Categoria: AI / Machine Learning

LN-Free GPT-2 + PEFT

Trabalho de Conclusão de Curso em Ciência da Computação (UNESP Bauru) investigando uma pergunta de eficiência em LLMs: o que acontece quando se remove a Layer Normalization do GPT-2 — e como recuperar a qualidade do modelo depois disso usando fine-tuning eficiente em parâmetros.

A pesquisa

A Layer Normalization é um dos componentes que encarecem a inferência de transformers. A pesquisa explora removê-la do GPT-2 e aplicar PEFT (Parameter-Efficient Fine-Tuning) para readaptar o modelo, ajustando apenas uma fração dos pesos em vez de re-treinar a rede inteira — uma combinação que busca inferência mais eficiente sem o custo de um treinamento completo.

Stack

  • PyTorch — framework de treinamento e experimentação
  • Hugging Face Transformers — base do GPT-2 e tooling de LLMs
  • PEFT — fine-tuning eficiente em parâmetros

Vision Transformers — DINOv2 & SigLIP 2

Estudo prático dos Vision Transformers mais recentes — DINOv2 e SigLIP 2 — implementados em notebooks Kaggle rodando em dual T4, cobrindo as duas grandes famílias de pré-treinamento visual da atualidade.

Abordagem

O DINOv2 representa o self-supervised learning: aprender representações visuais robustas sem rótulos. O SigLIP 2 representa a via contrastiva imagem-texto, com a função de perda sigmoide que dispensa batches gigantes. Implementar os dois lado a lado permite comparar na prática como cada paradigma se comporta em extração de features e transfer learning.

Os notebooks exploram o uso de duas GPUs T4 no Kaggle — distribuição de carga e gerenciamento de memória para modelos que não cabem confortavelmente em uma única GPU gratuita.

Stack

  • DINOv2 — features visuais self-supervised
  • SigLIP 2 — visão-linguagem com perda sigmoide
  • Kaggle + dual T4 — ambiente de experimentação com multi-GPU

3D Photogrammetric Reconstruction

Pipeline que reconstrói geometria 3D a partir de fotografias comuns: múltiplas imagens do mesmo objeto em ângulos diferentes entram, e um mesh 3D utilizável sai.

Como funciona

A reconstrução usa renderização diferenciável: o nvdiffrast renderiza a estimativa atual da geometria e compara com as fotos reais, e o erro retropropaga para refinar o modelo. O FlexiCubes entra como representação da superfície — uma extração de mesh baseada em grade que é otimizável por gradiente, gerando topologia limpa o suficiente para uso em ferramentas 3D convencionais.

Stack

  • FlexiCubes — extração de superfície otimizável por gradiente
  • nvdiffrast — renderização diferenciável acelerada por GPU
  • Multi-view photogrammetry — fotos comuns como entrada

Cidade Solar — Unity 3D Game

Protótipo de jogo 3D em Unity onde o jogador constrói e gerencia uma cidade movida a energia solar — um experimento de game design somado a sistemas de simulação.

Design

O núcleo do jogo são as mecânicas de sustentabilidade: equilibrar a geração solar com o consumo da cidade em crescimento. A modelagem procedural gera variação nos elementos urbanos sem exigir asset por asset, e os sistemas interativos — construção, energia, progressão — são implementados em C# sobre a arquitetura de componentes do Unity.

Stack

  • Unity — engine 3D e sistema de componentes
  • C# — gameplay, simulação de energia e interação
  • Geração procedural — variação de cenário em runtime