Registro do benchmark do Supermini Model, um experimento em escala reduzida usado para validar a pipeline de treinamento antes de partir para arquiteturas maiores.
Sobre
O benchmark do Supermini Model foi desenvolvido como um método de avaliação adaptado especificamente para este modelo. A proposta deste experimento não era construir um modelo de produção, mas validar a pipeline de treinamento desenvolvida anteriormente.
Por isso, optou-se por uma arquitetura extremamente pequena, um verdadeiro supermini model, capaz de permitir uma avaliação rápida do processo completo.
Dados
O treinamento foi realizado utilizando 739 milhões de tokens provenientes da Wikipedia, com batch size de 32 e gradient accumulation de 10, resultando em aproximadamente 332.800 tokens processados por passo.
Tokenizador
O modelo utiliza um vocabulário de aproximadamente 10 mil tokens, dimensionado de acordo com a escala reduzida da arquitetura testada.
Modelo
Trata-se de uma arquitetura compacta, dimensionada especificamente para permitir uma avaliação rápida de toda a pipeline.
| Parâmetro | Valor |
|---|---|
| Layers | 9 |
| Heads | 6 |
| Embedding dimension | 384 |
| Contexto | 1.040 tokens |
| Parâmetros | ~20 milhões |
| Vocabulário | ~10 mil tokens |
Treinamento
| Parâmetro | Valor |
|---|---|
| Tokens de treino | 739 milhões (Wikipedia) |
| Batch size | 32 |
| Gradient accumulation | 10 |
| Tokens por passo | ~332.800 |
| Total de passos | 2.220 |
Resultado
Ao final do treinamento, o modelo apresentou uma loss de 3,1285. Embora esse resultado indique que o modelo ainda apresentava capacidade de aprendizado, os dados observados ao longo do treinamento sugerem que sua capacidade de absorver conhecimento adicional já estava bastante limitada dentro das condições utilizadas.
Um dos pontos que merece atenção é o contexto de 1040 tokens. Para uma arquitetura tão pequena, essa configuração pode ter ultrapassado o ponto em que o aumento da janela de contexto traz benefícios proporcionais à capacidade do modelo. Em outras palavras, o modelo pode ter sido colocado diante de uma quantidade de contexto maior do que sua capacidade representacional conseguia aproveitar de maneira eficiente.
Benchmark
Dessa forma, o benchmark cumpriu seu principal objetivo: validar a pipeline e fornecer uma primeira indicação sobre o comportamento da arquitetura. Os resultados também servem como referência para os próximos experimentos, especialmente na avaliação da relação entre tamanho do modelo, janela de contexto, quantidade de dados e capacidade efetiva de aprendizado.
Notas
- Experimento realizado com o "Supermini Model", uma arquitetura deliberadamente pequena para validação rápida da pipeline, não representando o modelo final planejado.