Nucleo propio: oye con whisper.cpp, piensa con un modelo de Ollama, habla con Piper, y hace RAG sobre los apuntes del usuario. 100% local, sin cuentas ni claves. Escrito bajo una restriccion dura, 4 GB de VRAM: el cerebro y whisper comparten tarjeta y solo caben porque estan dimensionados para ello. El RAG usa embeddings estaticos con busqueda hibrida; la voz clonada se sirve de una cache de frases. Incluye instalador (install.sh), requisitos, y documentacion del stack, del manejo de root y de las acciones. Los apuntes indexados y el diario NO se incluyen: son privados y el .gitignore los bloquea.
26 lines
1.1 KiB
Text
26 lines
1.1 KiB
Text
# El modelo de JARVIS: qwen3.5 4B con parametros de asistente CONCISO.
|
|
#
|
|
# La build de qwen3.5 viene con temperature 1 y presence_penalty 1.5. Eso
|
|
# esta pensado para escritura creativa, no para un asistente de voz: el
|
|
# presence_penalty alto empuja al modelo a meter temas nuevos que no vienen a
|
|
# cuento —de ahi que acabara las frases soltando cuanta RAM queda— y la
|
|
# temperature alta lo hace divagar en vez de contestar y callar.
|
|
#
|
|
# Reconstruir: ollama create qwen3.5:4b-jarvis -f nucleo/cerebro/Modelfile
|
|
|
|
FROM qwen3.5:4b
|
|
|
|
# Bajo y estable: para "cuanto espacio queda" no hay creatividad que aportar,
|
|
# hay una cifra que dar.
|
|
PARAMETER temperature 0.4
|
|
# El que causaba el relleno. 0 = no penaliza repetir, asi que no siente la
|
|
# necesidad de introducir temas nuevos para variar.
|
|
PARAMETER presence_penalty 0.0
|
|
PARAMETER frequency_penalty 0.0
|
|
PARAMETER top_p 0.9
|
|
PARAMETER top_k 20
|
|
# Que pare cuando acabe la respuesta, no cuando se le acabe la cuerda.
|
|
PARAMETER num_predict 300
|
|
# 24 de 32 capas en la grafica: deja sitio a whisper en los 4 GB.
|
|
PARAMETER num_gpu 24
|
|
PARAMETER num_ctx 4096
|