Pruning
Camadas são removidas de forma orientada por redundância e impacto medido, procurando um corte que preserve a utilidade.
32 → 20 layersUm laboratório pessoal para explorar até onde um modelo pode ser comprimido, recuperado com LoRA e executado localmente com recursos modestos.
A ideia é simples de explicar e difícil de fazer: reduzir uma arquitetura maior sem transformar o modelo em uma casca vazia.
O projeto parte de um Qwen3.5 comprimido por pruning estrutural. Depois, o LoRA/QLoRA é usado para recuperar parte das capacidades perdidas e moldar o comportamento conversacional.
O objetivo não é criar um modelo especialista. É encontrar um ponto prático entre tamanho, velocidade, memória, qualidade e utilidade geral para inferência local.
Cada etapa responde uma pergunta diferente sobre compressão e recuperação de capacidade.
Camadas são removidas de forma orientada por redundância e impacto medido, procurando um corte que preserve a utilidade.
32 → 20 layersO modelo comprimido recebe adaptação de baixa memória para recuperar comportamento e melhorar a qualidade conversacional.
rank 64 · alpha 128A validação acontece no mundo real: modelos quantizados, llama.cpp, contexto grande e hardware limitado.
GGUF · llama.cppO alvo não é o menor modelo possível.
É descobrir o menor modelo que continua sendo realmente útil.A stack gira em torno de ferramentas que deixam a experiência mensurável e reproduzível em hardware comum.
A v0.1 estabelece a base. As próximas iterações podem testar novos cortes, datasets e estratégias de recuperação.
Releases, modelos e datasets ficam públicos na organização Rcscan.