El 21 de agosto de 2026, Hugging Face explicó cómo diseñó la infraestructura de búsqueda de Papers with Code, cuyo objetivo es facilitar el acceso a la investigación abierta en inteligencia artificial. El sistema permite localizar artículos, modelos y otros recursos relacionados tanto desde el sitio web como mediante el comando pwc search CLI, que también pueden utilizar agentes a través de Skill.
La compañía señala que buscar artículos científicos plantea retos distintos a los de una búsqueda textual convencional. Además de encontrar títulos exactos o identificadores de arXiv, el buscador debe interpretar consultas conceptuales, resolver peticiones de navegación como “the original BERT paper”, tolerar títulos incompletos y errores tipográficos, y mantener una respuesta rápida incluso cuando un servicio de modelos está temporalmente frío o no disponible.
Para abordar estas necesidades, Papers with Code utiliza un sistema de búsqueda híbrida. La búsqueda por palabras clave permite localizar menciones exactas, mientras que la búsqueda vectorial recupera términos semánticamente próximos. Ambas señales se combinan mediante el algoritmo reciprocal rank fusion (RRF). La base de datos PostgreSQL aporta la búsqueda de texto completo y pgvector incorpora la recuperación semántica mediante embeddings. Hugging Face también indica que los rerankers pueden mejorar los resultados, aunque añaden latencia y consumo de recursos.
La arquitectura separa el procesamiento masivo fuera de línea del servicio de consulta en línea. Hugging Face Jobs se ocupa de generar los embeddings del corpus con capacidad de cómputo GPU bajo demanda. Storage Buckets proporciona el almacenamiento persistente y el intercambio de datos entre la base de datos, los experimentos y los Jobs. Inference Endpoints genera los embeddings de las consultas en directo y de las actualizaciones incrementales con baja latencia.
El sistema mantiene embeddings de más de 110.000 artículos actuales procedentes de arXiv y Daily Papers. La generación de vectores se basa en Qwen/Qwen3-Embedding-0.6B, fijado a una revisión concreta, con vectores normalizados mediante L2 de 256 dimensiones. Papers with Code eligió ese tamaño para acelerar la búsqueda y reducir los costes de almacenamiento. Los documentos se codifican a partir del título normalizado y el resumen, mientras que las consultas utilizan el prompt específico para búsquedas que admiten los modelos de embeddings de Qwen.
Hugging Face trata el formato de los embeddings como una API versionada. Cada generación registra el repositorio y la revisión exacta del modelo, la dimensión de salida, la versión del formato de entrada, si el texto corresponde a una consulta o a un documento, el método de normalización y un hash del contenido de título y resumen. Este contrato permite mantener la coherencia desde la exportación de los datos hasta la inferencia en GPU, el almacenamiento en PostgreSQL y la recuperación en línea.
El proceso por lotes parte de una instantánea repeatable-read de PostgreSQL. El exportador transmite las filas, crea fragmentos JSONL de tamaño limitado y genera un manifiesto con el número de registros y sumas de comprobación SHA-256. Los datos se sincronizan con un Storage Bucket privado, que se monta directamente en un Job con una GPU NVIDIA L4 de 24 GB de VRAM.
El trabajador comprueba los manifiestos y los fragmentos, carga la revisión fijada del modelo, ordena los textos por longitud para reducir el relleno y procesa los documentos en lotes. También ajusta automáticamente el tamaño del lote si la GPU se queda sin memoria, trunca las representaciones a 256 dimensiones, las normaliza y escribe fragmentos Parquet en formato float16. Cada fragmento completado cuenta con un marcador propio, de modo que un Job reiniciado puede omitir el trabajo ya verificado.
En una prueba con 5.000 artículos, el Job basado en Qwen procesó unos 75 artículos por segundo a 1.024 dimensiones en una GPU L4. El mismo procesamiento podía materializarse de forma determinista a 512 y 256 dimensiones para comparar el impacto en almacenamiento y recuperación. Si el Inference Endpoint está frío, ocupado o no saludable, el sistema recurre inmediatamente a la búsqueda de texto completo.
Fuente: Hugging Face.