Visão Geral da Arquitetura Delta-IRIS
O projeto Delta-IRIS, que significa Modelos de Mundo Eficientes com Tokenização Consciente de Contexto, representa uma evolução significativa em agentes de aprendizado por reforço. A solução centraliza sua operação através de treinamento realizado dentro de mundos simulados imaginados, priorizando a eficiência computacional e a percepção contextual. Embora tenha sido apresentado academicamente em conferências de destaque no ano de 2024, seu código é mantido como software de acesso aberto.
Configuração do Ambiente de Desenvolvimento
Para iniciar a utilização da ferramenta, o sistema deve possuir uma versão compatível da linguagem Python (recomendado 3.8 ou superior). Abaixo descrevemos o procedimento adequado para preparar o ambiente.
Instalação das Bibliotecas Necessárias
Após clonar o repositório oficial, o primeiro passo envolve garantir que o gerenciador de pacotes esteja atualziado e instalar as dependências listadas. Execute os comandos abaixo na raiz do projeto:
# Otimizar o pip para evitar conflitos
python -m pip install --upgrade pip==23.0
# Carregar todas as bibliotecas requeridas pelo framework
pip install -r requirements.txt
O processo de execução padrão utiliza o ambiente Crafter. É possível monitorar o progresso criando logs automáticos em diretórios timestamped.
Execução Padrão (Crafter)
Para iniciar um ciclo de aprendizagem utilizando a configuração predefinida, utilize o script principal:
# Iniciar sessão de treino no ambiente Crafter
python src/main.py
Os resultados e checkpoints serão salvos estruturalmente sob outputs/YYYY-MM-DD/hh-mm-ss/.
Execução em Ambientes Atari
Caso deseje rodar experimentos em jogos específicos, como Breakout, ajuste os parâmetros dinâmicos via linha de comando. Esta configuração pode oferecer melhorias marginais nos benchmarks documentados:
# Especificar ambiente Atari e hiperparâmetros dedicados
python src/main.py env=atari params=atari env.train.id=BreakoutNoFrameskip-v4
Herramientas Avançadas e Manutenção
O ecossistema do Delta-IRIS oferece vários utilitários para manipular configurações, recuperar sessões perdidas e visualizar dados de desempenho.
Personalização de Parâmetros
A gestão de configuração é realizada através do pacote Hydra. Os arquivos definidos na pasta config/, principalmente trainer.yaml, controlam o comportamento do agente. Alterações diretas nesses arquivos YAML são a maneira mais eficaz de customizar o treinamento sem modificar o núcleo do código.
Recuperação de Sessões
Em cenários onde o treinamento é interrompido abruptamente devido a falhas de hardware ou limites de tempo, existe um script dedicado para retomar a execução do último checkpoint disponível:
# Retomar treinamento anterior onde foi interrompido
./scripts/resume.sh
Visualização Interativa
A análise do comportamento do agente pode ser feita em tempo real ou offline através do interpretador de vídeo embutido. O script play.sh suporta diferentes modos de visualização:
-w: Rnederizar o funcionamento interno do modelo de mundo.-a: Observar as ações tomadas pelo agente dentro da simulação mental.-e: Reproduzir episódios gravados armazenados na pastamedia/episodes.
# Exemplo: Rodar modo de ambiente físico real-time
./scripts/play.sh
# Exemplo: Analisar decisões do agente no espaço latente
./scripts/play.sh -a
Integração com Checkpoints Pré-Treinados
Pesquisadores podem acelerar testes carregando um agente já convergido. Um checkpoint correspondente a 5 milhões de frames no ambiente Crafter está disponível publicamente.
- Obtenha o arquivo binário
last.ptatravés do Hub da Hugging Face. - Assegure a existência do diretório
checkpointsna raiz. - Posicione o arquivo baixado em
checkpoints/last.pt. - Execute o script de playback referenciado anteriormente para validar o comportamento.
O projeto adota a licença GPL-3.0, garantindo liberdade para modificação e distribuição conforme as normas da comunidade de código aberto.