Texto a SQL en producción: por qué la demo funciona y el piloto no
Los modelos ya escriben SQL válido. El problema es que una consulta puede ejecutarse sin error y devolver el número equivocado con toda la confianza del mundo.
Pensamientos, tutoriales y experiencias sobre desarrollo web, arquitectura e ingeniería.
Los modelos ya escriben SQL válido. El problema es que una consulta puede ejecutarse sin error y devolver el número equivocado con toda la confianza del mundo.
El modelo grande acierta pero te arruina; el pequeño es barato pero falla. La destilación es el puente, y tiene más letra pequeña de la que cuentan.
No puedes comparar la salida con una cadena esperada. Casi todo lo que rodea a esa salida sí es determinista, y ahí es donde viven tus bugs.
Un 500 se detecta solo; una respuesta mediocre devuelve 200 OK y nadie se entera. La traza es la unidad que sirve.
El aprendizaje por refuerzo nunca fue imprescindible para alinear un LLM; DPO lo sustituye por una pérdida de clasificación y dos modelos en memoria.
Un agente que solo razona alucina con estilo; uno que solo actúa se pierde. ReAct los junta en el mismo turno, y por eso funciona.
Por qué casi todos los LLM modernos rotan sus vectores en vez de sumar posiciones.
Tu usuario no pregunta como está escrito tu corpus; arregla la consulta antes de recuperar.
Un modelo que responde al instante te da confianza y a veces un error. Pagar por dejarlo pensar cambia el trato, pero no siempre compensa.
El RAG por similitud responde bien a lo que vive en un párrafo. Se pierde cuando la respuesta está repartida entre documentos.
La autoatención escala mal, pero no por el número de operaciones. El cuello de botella real es el tráfico contra la memoria de la GPU, y ahí es donde se juega la partida.
Buscar una vez y rezar aguanta en la demo; en producción el sistema tiene que saber volver a buscar.