El patrón ReAct: razonar y actuar en el mismo bucle
Un agente que solo razona alucina con estilo; uno que solo actúa se pierde. ReAct los junta en el mismo turno, y por eso funciona.
Pensamientos, tutoriales y experiencias sobre desarrollo web, arquitectura e ingeniería.
Un agente que solo razona alucina con estilo; uno que solo actúa se pierde. ReAct los junta en el mismo turno, y por eso funciona.
Comprimir un documento en un vector pierde información. La interacción tardía la conserva, y a veces vale el coste.
Por qué casi todos los LLM modernos rotan sus vectores en vez de sumar posiciones.
Tu usuario no pregunta como está escrito tu corpus; arregla la consulta antes de recuperar.
Un modelo que responde al instante te da confianza y a veces un error. Pagar por dejarlo pensar cambia el trato, pero no siempre compensa.
Guardas vectores de 3072 dimensiones cuando 256 te bastarían. Así se recorta el coste sin romper la búsqueda.
El RAG por similitud responde bien a lo que vive en un párrafo. Se pierde cuando la respuesta está repartida entre documentos.
La autoatención escala mal, pero no por el número de operaciones. El cuello de botella real es el tráfico contra la memoria de la GPU, y ahí es donde se juega la partida.
Buscar una vez y rezar aguanta en la demo; en producción el sistema tiene que saber volver a buscar.
Sirviendo un LLM, la mayoría de tu VRAM se va en la KV cache y reservarla a lo bruto desperdicia más de la mitad. La solución la inventaron los sistemas operativos hace décadas.
El mismo modelo procesa mil tokens de golpe y luego sufre para escupir uno a uno. Entender por qué cambia cómo lo sirves.
Por qué los modelos modernos hacen que varias cabezas de atención compartan memoria, y qué ganas tú en latencia cuando entiendes el porqué.