Controle de Versão com Git para Experimentos de Fine-Tuning no Modelo Qwen3-ForcedAligner-0.6B

Projetos de ajuste fino de modelos como o Qwen3-ForcedAligner-0.6B frequentemente geram múltiplas versões de configurações e resultados. Git oferece rastreamento preciso de alterações, permitindo:

  • Registro histórico de modificações em hiperparâmetros
  • Isolamento de experimentos paralelos através de branches
  • Reprodutibilidade de configurações bem-sucedidas

Estrutura Inicial do Repositório

projeto-alinhador/
├── config/
│   ├── base.yml
│   ├── pt_en_misto.yml
│   └── recursos_minimos.yml
├── dados/
│   ├── brutos/         # .gitignore
│   └── processados/    # .gitignore
├── experimentos/
│   ├── 20240301_pt_align/
│   │   ├── treinamento.py
│   │   └── avaliacao.py
├── modelos/            # Git LFS
│   └── qwen3-forcedaligner-0.6B/
├── scripts/
│   ├── preparar_dados.sh
│   └── config_ambiente.sh
├── .gitattributes
└── .gitignore

Configuração de Ambiente

# Iniciar repositório
git init
echo "# Experimento Qwen3-ForcedAligner" > LEIAME.md

# Configurar Git LFS
git lfs install
git lfs track "modelos/**/*.bin"
git lfs track "modelos/**/*.safetensors"

# Exemplo .gitignore
dados/brutos/
experimentos/**/resultados/
__pycache__/
*.log

Estratégia de Branches para Experimentos

Padrão recomendado para branches:

tipo/objetivo/descricao

Exemplos:

  • exp/pt-align/dialeto-norte - Teste com dialetos regionais
  • exp/en-align/otimizacao-timestamp - Melhoria de precisão temporal

Fluxo de trabalho:

git checkout -b exp/pt-align/noticiarios
# Modificar arquivos de configuração
git commit -m "config: ajuste taxa aprendizado para 1.5e-5"
git push origin exp/pt-align/noticiarios

Versionamento de Configurações

Exemplo de configuração versionada:

# config/pt_en_misto.yml
modelo:
  nome: "Qwen/Qwen3-ForcedAligner-0.6B"
  precisao: "float16"

treinamento:
  taxa_aprendizado: 1.5e-5
  tamanho_lote: 12
  passos_aquecimento: 300

Herança de configurações:

# config/dialeto_pt.yml
herda: base.yml

dados:
  conjunto_treinamento: "dados/dialetos_pt"

Gestão de Grandes Arquivos

Configuração para modelos via Git LFS:

git lfs track "modelos/qwen3-forcedaligner-0.6B/*"
git add .gitattributes
git commit -m "lfs: rastrear pesos do modelo"

Download dos pesos:

python -c "from huggingface_hub import snapshot_download; snapshot_download(repo_id='Qwen/Qwen3-ForcedAligner-0.6B', local_dir='modelos')"

Colaboração em Equipe

Tempalte para pull requests:

## Objetivo
Melhorar precisão de alinhamento para sotaques regionais

## Métricas
| Indicador | Baseline | Nova Versão | Melhoria |
|-----------|----------|-------------|----------|
| AAS (ms)  | 42.1     | 37.5        | -10.9%   |

## Passos Reprodutibilidade
1. git checkout exp/pt-align/sotaques-v2
2. python scripts/preparar_dados.py --input dados/brutos
3. python experimentos/treinamento.py --config config/dialeto_pt.yml

Registro de experimentos:

## Log: Experimento sotaques
2024-03-15: Primeira execução - AAS 42.1ms
2024-03-17: Ajuste amostragem áudio - AAS 39.8ms
2024-03-19: Modificação arquitetura atenção - AAS 37.5ms

Tags: Git Git-LFS Qwen3 Alinhamento-de-Fala Versionamento-Configuracoes

Publicado em 8-2 10:09