Compreendendo a Quantização K_P
A abordagem de quantização K_P (rfeerindo-se a "Perfect") é uma técnica personalizada que aplica análises específicas ao modelo para preservar seletivamente os pesos mais críticos. Diferente dos métodos padrão, cada arquitetura recebe um perfil de otimização único. O resultado é um aumento de qualidade equivalente a um ou dois níveis superiores de quantização, com um custo de armazenamento adicional de apenas 5% a 15%. Esses arquivos GGUF são totalmente compatíveis com inferenciadores como llama.cpp e LM Studio, sem a necessidade de compilações personalizadas.
Especificações das Variantes Quantizadas
A tabela a seguir detalha as métricas de Bits Per Weight (BPW) e o tamanho em disco de cada iteração do modelo de 27 bilhões de parâmetros. Todos os arquivos foram gerados utilizando matrizes de importância (imatrix) para mitigar a degradação da precisão durante o descarte de pesos.
| Arquivo GGUF | Esquema | BPW | Tamanho |
|---|---|---|---|
| Qwen3.6-27B-...-Q8_K_P.gguf | Q8_K_P | 10.06 | 32 GB |
| Qwen3.6-27B-...-Q6_K_P.gguf | Q6_K_P | 7.07 | 23 GB |
| Qwen3.6-27B-...-Q5_K_P.gguf | Q5_K_P | 6.47 | 21 GB |
| Qwen3.6-27B-...-Q4_K_P.gguf | Q4_K_P | 5.40 | 18 GB |
| Qwen3.6-27B-...-IQ4_XS.gguf | IQ4_XS | 4.32 | 15 GB |
| Qwen3.6-27B-...-Q3_K_P.gguf | Q3_K_P | 4.39 | 14 GB |
| Qwen3.6-27B-...-IQ3_M.gguf | IQ3_M | 3.56 | 13 GB |
| Qwen3.6-27B-...-IQ3_XS.gguf | IQ3_XS | 3.30 | 12 GB |
| Qwen3.6-27B-...-Q2_K_P.gguf | Q2_K_P | 3.19 | 12 GB |
| Qwen3.6-27B-...-IQ2_M.gguf | IQ2_M | 2.69 | 10 GB |
Nota: Os nomes dos arquivos foram abreviados na tabela para facilitar a leitura.
Recomendações de Implantação por Cenário
1. Cargas de Trbaalho de Alta Fidelidade: Q8_K_P (32 GB)
Para ambientes com VRAM abundante (acima de 32 GB) onde a precisão próxima ao BF16 é mandatória, a variante Q8_K_P é a mais indicada. Ela entrega entre 75% e 99% da performance do modelo original, consumindo aproximadamente metade da memória que a versão em precisão total exigiria. É ideal para raciocínio complexo e tarefas críticas.
2. Equilíbrio entre Eficiência e Capacidade: Q4_K_P (18 GB)
A quantização Q4_K_P atua como o ponto ideal para a maioria das aplicações de desenvolvimento e agentes autônomos. Com 18 GB, ela cabe confortavelmente em GPUs de 24 GB, deixando margem para janelas de contexto extensas. Oferece uma excelente relação custo-benefício para uso de ferramentas e geração de código.
3. Hardware com Restrições de Memória: Q2_K_P e IQ2_M (10 a 12 GB)
Em setups com limitações rigorosas de VRAM, as opções Q2_K_P (12 GB) e IQ2_M (10 GB) permitem a execução do modelo. Embora haja uma perda perceptível na capacidade de raciocínio profundo, essas versões são perfeitamente viáveis para bate-papo, sumarização e geração de texto simples.
Arquitetura e Configurações de Inferência
O modelo base possui 27 bilhões de parâmetros densos, distribuídos em 64 camadas com uma topologia híbrida: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)). Isso inclui 48 camadas de atenção linear e 16 de atenção totalmente gateada. O contexto nativo é de 262K tokens, expansível para cerca de 1 milhão via YaRN, e suporta nativamente entradas multimodais.
Parâmetros de Amostragem Sugeridos
Ajustar a temperatura e as penalidades é crucial para extrair o melhor desempenho do modelo em diferentes modos de operação:
- Modo de Pensamento (Tarefas Gerais):
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0 - Modo de Pensamento (Codificação Exata/Web):
temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0 - Modo de Instrução Direta (Sem Pensamento):
temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
Para manter a capacidade de raciocínio em cadeia (Chain-of-Thought), configure o contexto para no mínimo 128K tokens. O limite de geração (max_tokens) deve ser definido em 32.768 para a maioria dos casos, podendo chegar a 81.920 para resolução de problemas matemáticos avançados ou código extenso.
Execução via Linha de Comando
A integração com o ecossistema GGUF é direta. Abaixo está um exemplo de como inicializar a inferência utilizando o llama.cpp, com os parâmetros reorganizados para maior clareza e uso de caminhos relativos:
llama-cli \
--ctx-size 131072 \
--n-gpu-layers 99 \
--jinja \
--model ./weights/qwen27b_uncensored_q4kp.gguf \
--mmproj ./weights/mmproj_qwen27b_vision_f16.gguf
Para obter os pesos e arquivos de projeção multimodal, clone o repositório para um diretório local específico:
git clone https://gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Balanced ./local_models/qwen27b_balanced