Cuantización: correr modelos grandes sin fundir la GPU
Un modelo de 70B no cabe en tu tarjeta. Cuantizarlo lo mete dentro casi sin que se note. Casi.
Pensamientos, tutoriales y experiencias sobre desarrollo web, arquitectura e ingeniería.
Un modelo de 70B no cabe en tu tarjeta. Cuantizarlo lo mete dentro casi sin que se note. Casi.
El descuento más fácil de tu factura de LLM está en dejar de reenviar el mismo contexto una y otra vez.
El modelo no lee letras ni palabras: lee trozos. Y ese detalle explica la mitad de sus rarezas.
No compiten por el mismo trabajo. Uno cambia lo que el modelo sabe; el otro, cómo se comporta. Confundirlos sale caro.
No es un bug que se parchea con más instrucciones. Es la consecuencia de mezclar datos e instrucciones en el mismo canal.
Una ventana de contexto grande no es memoria. Distinguirlas es la diferencia entre un agente y un chat con amnesia.
El vector te trae diez candidatos, pero el orden en que llegan casi nunca es el bueno. Notas de campo sobre añadir un reranker sin arruinar la latencia.
Casi todos los fallos de recuperación no son culpa del embedding, sino de cómo troceaste el texto. Notas de campo para partir documentos sin romper el sentido.
Sacar datos de un LLM con expresiones regulares es una bomba de relojería. Notas de campo para obtener JSON que valida a la primera y no te revienta en producción.
Un panel que nadie abre no es neutro: cuesta tiempo, atención y credibilidad. Notas de campo para construir dashboards que cambian una decisión.
El mismo contexto, viajando una y otra vez. Ahí está tu factura, y ahí está la palanca.
La retro no es un ritual de quejas ni una terapia de grupo: es la única reunión que existe para cambiar algo.