independent local AI research

Modelos menores.
Ainda úteis.

Um laboratório pessoal para explorar até onde um modelo pode ser comprimido, recuperado com LoRA e executado localmente com recursos modestos.

RCscan / Experimental PT-BR · EN Open models · Apache 2.0
~4B → ~2.8Bparâmetros
32 → 20camadas
~30%menor
4-bitQLoRA / GGUF
262Kcontexto arquitetural
01 / SELENA

Selena é o experimento central.

A ideia é simples de explicar e difícil de fazer: reduzir uma arquitetura maior sem transformar o modelo em uma casca vazia.

O projeto parte de um Qwen3.5 comprimido por pruning estrutural. Depois, o LoRA/QLoRA é usado para recuperar parte das capacidades perdidas e moldar o comportamento conversacional.

O objetivo não é criar um modelo especialista. É encontrar um ponto prático entre tamanho, velocidade, memória, qualidade e utilidade geral para inferência local.

current baseline
Qwen3.5-2.8B v0.1
Base
Qwen3.5
Layers
20
Hidden
2560
Attention
16 / 4 KV
FFN
9216
Quant
4-bit
Context
262,144
Languages
PT-BR / EN
Abrir modelo base →
02 / PESQUISA

Do corte ao comportamento.

Cada etapa responde uma pergunta diferente sobre compressão e recuperação de capacidade.

01
⌬

Pruning

Camadas são removidas de forma orientada por redundância e impacto medido, procurando um corte que preserve a utilidade.

32 → 20 layers
02
◈

QLoRA

O modelo comprimido recebe adaptação de baixa memória para recuperar comportamento e melhorar a qualidade conversacional.

rank 64 · alpha 128
03
⌁

Local inference

A validação acontece no mundo real: modelos quantizados, llama.cpp, contexto grande e hardware limitado.

GGUF · llama.cpp
“

O alvo não é o menor modelo possível.

É descobrir o menor modelo que continua sendo realmente útil.
03 / STACK

Pesquisa feita perto do metal.

A stack gira em torno de ferramentas que deixam a experiência mensurável e reproduzível em hardware comum.

01
Hugging Facemodelos, datasets e releases
02
QLoRA / PEFTadaptação eficiente em memória
03
GGUF + llama.cppinferência local e quantização
04
Experimentos de pruningcomparação de perdas, cortes e qualidade
04 / DIREÇÃO

Um baseline, não um ponto final.

A v0.1 estabelece a base. As próximas iterações podem testar novos cortes, datasets e estratégias de recuperação.

✓
Qwen3.5 comprimidobase estrutural reduzida
✓
QLoRA v0.1recuperação de comportamento
03
Dataset & estilomais dados naturais e diversidade linguística
04
Novos cortesbuscar o próximo ponto útil de compressão