Pré-treinamento de LLMs

Uma visão geral das etapas de construção e avaliação de modelos de linguagem.

Diagrama do fluxo de pré-treinamento de um LLM

Imagem desenvolvida por Marcos Junior Lemes

Visão geral do pipeline de pré-treinamento, do dado bruto ao benchmark.

Registro do benchmark do Supermini Model, um experimento em escala reduzida usado para validar a pipeline de treinamento antes de partir para arquiteturas maiores.

Sobre

O benchmark do Supermini Model foi desenvolvido como um método de avaliação adaptado especificamente para este modelo. A proposta deste experimento não era construir um modelo de produção, mas validar a pipeline de treinamento desenvolvida anteriormente.

Por isso, optou-se por uma arquitetura extremamente pequena, um verdadeiro supermini model, capaz de permitir uma avaliação rápida do processo completo.

Dados

O treinamento foi realizado utilizando 739 milhões de tokens provenientes da Wikipedia, com batch size de 32 e gradient accumulation de 10, resultando em aproximadamente 332.800 tokens processados por passo.

Tokenizador

O modelo utiliza um vocabulário de aproximadamente 10 mil tokens, dimensionado de acordo com a escala reduzida da arquitetura testada.

Modelo

Trata-se de uma arquitetura compacta, dimensionada especificamente para permitir uma avaliação rápida de toda a pipeline.

Especificações do Supermini Model
ParâmetroValor
Layers9
Heads6
Embedding dimension384
Contexto1.040 tokens
Parâmetros~20 milhões
Vocabulário~10 mil tokens

Treinamento

Configuração do treinamento
ParâmetroValor
Tokens de treino739 milhões (Wikipedia)
Batch size32
Gradient accumulation10
Tokens por passo~332.800
Total de passos2.220

Resultado

Ao final do treinamento, o modelo apresentou uma loss de 3,1285. Embora esse resultado indique que o modelo ainda apresentava capacidade de aprendizado, os dados observados ao longo do treinamento sugerem que sua capacidade de absorver conhecimento adicional já estava bastante limitada dentro das condições utilizadas.

Loss final: 3,1285

Um dos pontos que merece atenção é o contexto de 1040 tokens. Para uma arquitetura tão pequena, essa configuração pode ter ultrapassado o ponto em que o aumento da janela de contexto traz benefícios proporcionais à capacidade do modelo. Em outras palavras, o modelo pode ter sido colocado diante de uma quantidade de contexto maior do que sua capacidade representacional conseguia aproveitar de maneira eficiente.

Benchmark

Dessa forma, o benchmark cumpriu seu principal objetivo: validar a pipeline e fornecer uma primeira indicação sobre o comportamento da arquitetura. Os resultados também servem como referência para os próximos experimentos, especialmente na avaliação da relação entre tamanho do modelo, janela de contexto, quantidade de dados e capacidade efetiva de aprendizado.

Notas

  1. Experimento realizado com o "Supermini Model", uma arquitetura deliberadamente pequena para validação rápida da pipeline, não representando o modelo final planejado.