LN-Free GPT-2 + PEFT

PyTorch Transformers PEFT LayerNorm-Free

Trabalho de Conclusão de Curso em Ciência da Computação (UNESP Bauru) investigando uma pergunta de eficiência em LLMs: o que acontece quando se remove a Layer Normalization do GPT-2 — e como recuperar a qualidade do modelo depois disso usando fine-tuning eficiente em parâmetros.

A pesquisa

A Layer Normalization é um dos componentes que encarecem a inferência de transformers. A pesquisa explora removê-la do GPT-2 e aplicar PEFT (Parameter-Efficient Fine-Tuning) para readaptar o modelo, ajustando apenas uma fração dos pesos em vez de re-treinar a rede inteira — uma combinação que busca inferência mais eficiente sem o custo de um treinamento completo.

Stack

  • PyTorch — framework de treinamento e experimentação
  • Hugging Face Transformers — base do GPT-2 e tooling de LLMs
  • PEFT — fine-tuning eficiente em parâmetros

Quer conversar sobre este projeto ou construir algo parecido?

Entrar em contato