# El modelo de JARVIS: qwen3.5 4B con parametros de asistente CONCISO.
#
# La build de qwen3.5 viene con temperature 1 y presence_penalty 1.5. Eso
# esta pensado para escritura creativa, no para un asistente de voz: el
# presence_penalty alto empuja al modelo a meter temas nuevos que no vienen a
# cuento —de ahi que acabara las frases soltando cuanta RAM queda— y la
# temperature alta lo hace divagar en vez de contestar y callar.
#
# Reconstruir:  ollama create qwen3.5:4b-jarvis -f nucleo/cerebro/Modelfile

FROM qwen3.5:4b

# Bajo y estable: para "cuanto espacio queda" no hay creatividad que aportar,
# hay una cifra que dar.
PARAMETER temperature 0.4
# El que causaba el relleno. 0 = no penaliza repetir, asi que no siente la
# necesidad de introducir temas nuevos para variar.
PARAMETER presence_penalty 0.0
PARAMETER frequency_penalty 0.0
PARAMETER top_p 0.9
PARAMETER top_k 20
# Que pare cuando acabe la respuesta, no cuando se le acabe la cuerda. En una
# tarjeta con mas VRAM puedes subirlo (voz corta no lo necesita, pero el RAG
# agentico si agradece mas margen).
PARAMETER num_predict 300
PARAMETER num_ctx 4096
# num_gpu NO se fija: Ollama reparte las capas segun la VRAM de tu tarjeta, asi
# el modelo va igual en una GPU pequeña, en una grande o en CPU. Solo fijalo si
# necesitas reservar VRAM a whisper en una tarjeta muy justa (4 GB): num_gpu 24.
