Proyector de embeddings

Proyector de embeddings – visualización de datos multidimensionales

Corpus

Este conjunto de datos fue construido a partir de la obra édita digitalizada de José Luis Romero (JLR) y de los escritos de la sección Temas y Conceptos (TyC), en el estado en que se encontraba la digitalización al 1 de julio de 2026:

  • José Luis Romero (JLR): 387 documentos
  • Temas y Conceptos (TyC): 79 documentos
  • Total: 466 documentos

Tensores

Los embeddings se generaron en dos niveles, a partir del mismo corpus:

  1. Por chunk: cada documento se dividió en fragmentos de texto (chunks) para su indexación. En total se generaron 2021 chunks (1605 de JLR, 416 de TyC). Cada chunk fue embebido de forma independiente con el modelo Qwen3 (vectores de 4096 dimensiones), el mismo modelo usado en producción para la búsqueda semántica de la API RAG del proyecto.
  2. Por documento (dataset publicado en este proyector): los vectores de todos los chunks pertenecientes a un mismo documento se promediaron (mean pooling) y se normalizaron (norma L2) para obtener un único vector representativo por documento. Este criterio replica exactamente el usado para construir la tabla “docs” del índice Qwen3 en producción (LanceDB). El resultado son 466 vectores de 4096 dimensiones, uno por documento.

Este proyector permite visualizar cómo agrupa semánticamente el modelo Qwen3 los documentos de José Luis Romero y de Temas y Conceptos (escritos de especialistas sobre la obra de J L Romero).