Texto a SQL en producción: por qué la demo funciona y el piloto no
Los modelos ya escriben SQL válido. El problema es que una consulta puede ejecutarse sin error y devolver el número equivocado con toda la confianza del mundo.
Pensamientos, tutoriales y experiencias sobre desarrollo web, arquitectura e ingeniería.
Los modelos ya escriben SQL válido. El problema es que una consulta puede ejecutarse sin error y devolver el número equivocado con toda la confianza del mundo.
Tu pipeline de RAG pierde información en el parser, no en el modelo. Incrustar la página como imagen elimina ese paso, y trae una factura de almacenamiento que conviene mirar antes.
El modelo grande acierta pero te arruina; el pequeño es barato pero falla. La destilación es el puente, y tiene más letra pequeña de la que cuentan.
Un índice vectorial no sabe quién pregunta. Si no se lo dices tú, tu buscador interno se convierte en una fuga de datos con buena redacción.
Ajustas el chunking, cambias el reranker, subes el recall. Y el corpus sigue roto desde la primera línea, porque el PDF nunca fue texto.
No puedes comparar la salida con una cadena esperada. Casi todo lo que rodea a esa salida sí es determinista, y ahí es donde viven tus bugs.
Tu recuperación no falla por el modelo de embeddings; falla porque el índice descarta candidatos en silencio y nadie mide cuántos.
Un span de 14 segundos llamado POST /v1/messages no es observabilidad. Cómo OpenTelemetry abre la caja negra del agente y qué parte de la especificación puedes usar ya.
Un 500 se detecta solo; una respuesta mediocre devuelve 200 OK y nadie se entera. La traza es la unidad que sirve.
El aprendizaje por refuerzo nunca fue imprescindible para alinear un LLM; DPO lo sustituye por una pérdida de clasificación y dos modelos en memoria.
Trocear un documento tira a la basura el contexto que hace recuperable cada chunk; recupéralo antes de indexar.
Tu base vectorial no crece por los documentos, crece por los float32. Aquí está el recorte que casi nadie aplica.