Portabilidad (el repo estaba escrito como si solo sirviera para el portatil del autor): - num_gpu ya NO se fija en los Modelfile: Ollama reparte las capas segun la VRAM, asi el modelo va igual en GPU pequeña, grande o CPU. Se documenta cuando conviene fijarlo (solo tarjetas de 4 GB muy justas). - install.sh detecta el gestor de paquetes (apt/dnf/pacman/zypper) y la GPU (NVIDIA/AMD/ninguna), sin asumir Debian ni CUDA. - README reescrito: el hardware es una REFERENCIA (lo probado), no un requisito. Nueva seccion de portabilidad: cualquier distro, cualquier escritorio (ventanas necesitan X11+xdotool, degradan solas en Wayland), GPU opcional. - Eliminado config/jarvis-herramientas.json: llevaba rutas personales. Licencia: GPL-3.0 (copyleft). docs/stack.svg: diagrama del stack (oir-pensar-hacer-hablar), reemplaza el ASCII en el README. Anadido que el RAG sube la recuperacion de 48 a 82% (hit@1) medido.
29 lines
1.3 KiB
Text
29 lines
1.3 KiB
Text
# El modelo de JARVIS: qwen3.5 4B con parametros de asistente CONCISO.
|
|
#
|
|
# La build de qwen3.5 viene con temperature 1 y presence_penalty 1.5. Eso
|
|
# esta pensado para escritura creativa, no para un asistente de voz: el
|
|
# presence_penalty alto empuja al modelo a meter temas nuevos que no vienen a
|
|
# cuento —de ahi que acabara las frases soltando cuanta RAM queda— y la
|
|
# temperature alta lo hace divagar en vez de contestar y callar.
|
|
#
|
|
# Reconstruir: ollama create qwen3.5:4b-jarvis -f nucleo/cerebro/Modelfile
|
|
|
|
FROM qwen3.5:4b
|
|
|
|
# Bajo y estable: para "cuanto espacio queda" no hay creatividad que aportar,
|
|
# hay una cifra que dar.
|
|
PARAMETER temperature 0.4
|
|
# El que causaba el relleno. 0 = no penaliza repetir, asi que no siente la
|
|
# necesidad de introducir temas nuevos para variar.
|
|
PARAMETER presence_penalty 0.0
|
|
PARAMETER frequency_penalty 0.0
|
|
PARAMETER top_p 0.9
|
|
PARAMETER top_k 20
|
|
# Que pare cuando acabe la respuesta, no cuando se le acabe la cuerda. En una
|
|
# tarjeta con mas VRAM puedes subirlo (voz corta no lo necesita, pero el RAG
|
|
# agentico si agradece mas margen).
|
|
PARAMETER num_predict 300
|
|
PARAMETER num_ctx 4096
|
|
# num_gpu NO se fija: Ollama reparte las capas segun la VRAM de tu tarjeta, asi
|
|
# el modelo va igual en una GPU pequeña, en una grande o en CPU. Solo fijalo si
|
|
# necesitas reservar VRAM a whisper en una tarjeta muy justa (4 GB): num_gpu 24.
|