Contexto e Motivação
A execução local de modelos de linguagem grande (LLMs) como o DeepSeek-R1 oferece uma alternativa estável e privada em comparação com o uso de APIs públicas, que podem apresentar instabilidades ou limites de taxa. Este guia detalha o processo de configuração de um ambiente local no Windows utilizando o Ollama como motor de inferência e o ChatBoxAI como interface gráfica.
- Instalação do Motor de Inferência (Ollama)
O Ollama é a ferramenta responsável por gerenciar e executar os modelos localmente.
- Acesse o site oficial do Ollama e navegue até a seção de downloads.
- Selecione a versão para Windows e aguarde a conclusão do download do instalador.
- Execute o arquivo baixado e siga as instruções do assistente de instalação, clicando em
Install. - Após a instalação, verifique a bandeja do sistema (canto inferior direito da tela). O ícone do Ollama deve estar visível, indicando que o serviço está ativo em segundo plano. Mantenha este processo em execução.
- Configuração da Interface Gráfica (ChatBoxAI)
O ChatBoxAI fornecerá uma interface amigável para interagir com o modelo.
- Visite o site oficial do ChatBoxAI e baixe o instalador para Windows.
- Execute o instalador, defina o diretório de destino e conclua a instalação.
- Ao abrir o aplicativo pela primeira vez, uma janela de boas-vindas será exibida. Feche esta janela inicial, pois a configuração da API será feita nas etapas seguintes.
- Obtenção do Modelo DeepSeek-R1
O download do modelo é realizado via linha de comando.
- Pressione
Win + R, digitecmde pressione Enter para abrir o Prompt de Comando. - Verifique se o Ollama foi instalado corretamente executando o seguinte comando:
ollama --version
Se a versão for exibida, o ambiente está pronto. Caso contrário, revise a instalação do Ollama.
- Acesse a biblioteca de modelos no site do Ollama e localize o
deepseek-r1. - Selecione a variante (tag) do modelo que melhor se adapta ao seu hardwrae (consulte a seção de Requisitos de Hardware abaixo).
- Copie o comando de instalação fornecido na página.
- Cole o comando no Prompt de Comando e pressione Enter. Aguarde até que o download seja concluído e a mensagem de sucesso seja exibida.
Exemplo de comando para baixar a versão de 7 bilhões de parâmetros:
ollama pull deepseek-r1:7b
- Integração e Testes
Com o modelo baixado, é necessário conectá-lo à interface gráfica.
- Abra o ChatBoxAI e acesse as
Configurações(Settings). - No menu
Provedor de Modelo(Model Provider), selecioneOllama API. - No menu suspenso
Modelo(Model), escolha a variante do DeepSeek-R1 que você acabou de baixar. - Salve as configurações.
- Envie uma mensagem de teste na tela principal para verificar se a inferência está ocorrendo corretamente. O fechamento do ChatBoxAI não encerrará o serviço do Ollama em segundo plano, mas fechará a interface de chat.
- Requisitos de Hardware e Seleção de Variantes
A escolha do modelo DeepSeek-R1 deve ser baseada estritamente na capacidade do seu hardware. Abaixo estão as diretrizes para as versões destiladas:
Recomendações Gerais de Hardware para LLMs Locais
- CPU: Mínimo de 8 núcleos; 16 núcleos ou mais é o ideal.
- GPU: Mínimo de 16GB de VRAM; 24GB ou mais (ex: NVIDIA RTX 3090, 4090) para desempenho otimizado.
- RAM: Mínimo de 32GB; 64GB ou mais para modelos maiores.
- Armazenamento: Mínimo de 100GB livres em SSD (NVMe recomendado para reduzir o tempo de carregamento do modelo na memória).
Mapeamento de Variantes do DeepSeek-R1
- Modelos Pequenos (1.5b, 7b, 8b): Ideais para ambientes com recursos limitados. Requerem aproximadamente 8GB de VRAM e 16GB de RAM do sistema.
- Modelos Médios (14b): Exigem cerca de 16GB de VRAM e 32GB de RAM do sistema.
- Modelos Grandes (32b): Demandam aproximadamente 24GB de VRAM e 64GB de RAM do sistema.
Variantes com maior número de parâmetros geralmente excedem a capacidade de hardware de estações de traablho convencionais e não são recomendadas para implantação local por usuários finais sem infraestrutura de servidor dedicada. O desempenho real pode variar dependendo da otimização do sistema e da velocidade do barramento de memória.