Projetos de ajuste fino de modelos como o Qwen3-ForcedAligner-0.6B frequentemente geram múltiplas versões de configurações e resultados. Git oferece rastreamento preciso de alterações, permitindo:
- Registro histórico de modificações em hiperparâmetros
- Isolamento de experimentos paralelos através de branches
- Reprodutibilidade de configurações bem-sucedidas
Estrutura Inicial do Repositório
projeto-alinhador/
├── config/
│ ├── base.yml
│ ├── pt_en_misto.yml
│ └── recursos_minimos.yml
├── dados/
│ ├── brutos/ # .gitignore
│ └── processados/ # .gitignore
├── experimentos/
│ ├── 20240301_pt_align/
│ │ ├── treinamento.py
│ │ └── avaliacao.py
├── modelos/ # Git LFS
│ └── qwen3-forcedaligner-0.6B/
├── scripts/
│ ├── preparar_dados.sh
│ └── config_ambiente.sh
├── .gitattributes
└── .gitignore
Configuração de Ambiente
# Iniciar repositório
git init
echo "# Experimento Qwen3-ForcedAligner" > LEIAME.md
# Configurar Git LFS
git lfs install
git lfs track "modelos/**/*.bin"
git lfs track "modelos/**/*.safetensors"
# Exemplo .gitignore
dados/brutos/
experimentos/**/resultados/
__pycache__/
*.log
Estratégia de Branches para Experimentos
Padrão recomendado para branches:
tipo/objetivo/descricao
Exemplos:
exp/pt-align/dialeto-norte- Teste com dialetos regionaisexp/en-align/otimizacao-timestamp- Melhoria de precisão temporal
Fluxo de trabalho:
git checkout -b exp/pt-align/noticiarios
# Modificar arquivos de configuração
git commit -m "config: ajuste taxa aprendizado para 1.5e-5"
git push origin exp/pt-align/noticiarios
Versionamento de Configurações
Exemplo de configuração versionada:
# config/pt_en_misto.yml
modelo:
nome: "Qwen/Qwen3-ForcedAligner-0.6B"
precisao: "float16"
treinamento:
taxa_aprendizado: 1.5e-5
tamanho_lote: 12
passos_aquecimento: 300
Herança de configurações:
# config/dialeto_pt.yml
herda: base.yml
dados:
conjunto_treinamento: "dados/dialetos_pt"
Gestão de Grandes Arquivos
Configuração para modelos via Git LFS:
git lfs track "modelos/qwen3-forcedaligner-0.6B/*"
git add .gitattributes
git commit -m "lfs: rastrear pesos do modelo"
Download dos pesos:
python -c "from huggingface_hub import snapshot_download; snapshot_download(repo_id='Qwen/Qwen3-ForcedAligner-0.6B', local_dir='modelos')"
Colaboração em Equipe
Tempalte para pull requests:
## Objetivo
Melhorar precisão de alinhamento para sotaques regionais
## Métricas
| Indicador | Baseline | Nova Versão | Melhoria |
|-----------|----------|-------------|----------|
| AAS (ms) | 42.1 | 37.5 | -10.9% |
## Passos Reprodutibilidade
1. git checkout exp/pt-align/sotaques-v2
2. python scripts/preparar_dados.py --input dados/brutos
3. python experimentos/treinamento.py --config config/dialeto_pt.yml
Registro de experimentos:
## Log: Experimento sotaques
2024-03-15: Primeira execução - AAS 42.1ms
2024-03-17: Ajuste amostragem áudio - AAS 39.8ms
2024-03-19: Modificação arquitetura atenção - AAS 37.5ms