Manual de Configuração e Operação do Framework Delta-IRIS

Visão Geral da Arquitetura Delta-IRIS

O projeto Delta-IRIS, que significa Modelos de Mundo Eficientes com Tokenização Consciente de Contexto, representa uma evolução significativa em agentes de aprendizado por reforço. A solução centraliza sua operação através de treinamento realizado dentro de mundos simulados imaginados, priorizando a eficiência computacional e a percepção contextual. Embora tenha sido apresentado academicamente em conferências de destaque no ano de 2024, seu código é mantido como software de acesso aberto.

Configuração do Ambiente de Desenvolvimento

Para iniciar a utilização da ferramenta, o sistema deve possuir uma versão compatível da linguagem Python (recomendado 3.8 ou superior). Abaixo descrevemos o procedimento adequado para preparar o ambiente.

Instalação das Bibliotecas Necessárias

Após clonar o repositório oficial, o primeiro passo envolve garantir que o gerenciador de pacotes esteja atualziado e instalar as dependências listadas. Execute os comandos abaixo na raiz do projeto:

# Otimizar o pip para evitar conflitos
python -m pip install --upgrade pip==23.0

# Carregar todas as bibliotecas requeridas pelo framework
pip install -r requirements.txt

O processo de execução padrão utiliza o ambiente Crafter. É possível monitorar o progresso criando logs automáticos em diretórios timestamped.

Execução Padrão (Crafter)

Para iniciar um ciclo de aprendizagem utilizando a configuração predefinida, utilize o script principal:

# Iniciar sessão de treino no ambiente Crafter
python src/main.py

Os resultados e checkpoints serão salvos estruturalmente sob outputs/YYYY-MM-DD/hh-mm-ss/.

Execução em Ambientes Atari

Caso deseje rodar experimentos em jogos específicos, como Breakout, ajuste os parâmetros dinâmicos via linha de comando. Esta configuração pode oferecer melhorias marginais nos benchmarks documentados:

# Especificar ambiente Atari e hiperparâmetros dedicados
python src/main.py env=atari params=atari env.train.id=BreakoutNoFrameskip-v4

Herramientas Avançadas e Manutenção

O ecossistema do Delta-IRIS oferece vários utilitários para manipular configurações, recuperar sessões perdidas e visualizar dados de desempenho.

Personalização de Parâmetros

A gestão de configuração é realizada através do pacote Hydra. Os arquivos definidos na pasta config/, principalmente trainer.yaml, controlam o comportamento do agente. Alterações diretas nesses arquivos YAML são a maneira mais eficaz de customizar o treinamento sem modificar o núcleo do código.

Recuperação de Sessões

Em cenários onde o treinamento é interrompido abruptamente devido a falhas de hardware ou limites de tempo, existe um script dedicado para retomar a execução do último checkpoint disponível:

# Retomar treinamento anterior onde foi interrompido
./scripts/resume.sh

Visualização Interativa

A análise do comportamento do agente pode ser feita em tempo real ou offline através do interpretador de vídeo embutido. O script play.sh suporta diferentes modos de visualização:

  • -w: Rnederizar o funcionamento interno do modelo de mundo.
  • -a: Observar as ações tomadas pelo agente dentro da simulação mental.
  • -e: Reproduzir episódios gravados armazenados na pasta media/episodes.
# Exemplo: Rodar modo de ambiente físico real-time
./scripts/play.sh 

# Exemplo: Analisar decisões do agente no espaço latente
./scripts/play.sh -a

Integração com Checkpoints Pré-Treinados

Pesquisadores podem acelerar testes carregando um agente já convergido. Um checkpoint correspondente a 5 milhões de frames no ambiente Crafter está disponível publicamente.

  1. Obtenha o arquivo binário last.pt através do Hub da Hugging Face.
  2. Assegure a existência do diretório checkpoints na raiz.
  3. Posicione o arquivo baixado em checkpoints/last.pt.
  4. Execute o script de playback referenciado anteriormente para validar o comportamento.

O projeto adota a licença GPL-3.0, garantindo liberdade para modificação e distribuição conforme as normas da comunidade de código aberto.

Tags: deep-learning Reinforcement-Learning world-models Python hydra-config

Publicado em 8-18 11:31