Experimentar con rigor
Categoría: Tecnología

El 31 de julio de 2025 se cerró el corte de datos del primer corpus de LatamGPT. Lo que quedó dentro son 188 millones de documentos, 296,500 millones de tokens y 152 datasets provenientes de veinte países. Sobre esa base, un equipo coordinado desde el Centro Nacional de Inteligencia Artificial de Chile realizó un preentrenamiento continuo sobre Llama 3.1 de 70,000 millones de parámetros, aplicó ajuste supervisado y publicó el modelo resultante en acceso abierto. La región produjo su primer modelo de lenguaje entrenado deliberadamente con su propia memoria cultural. El dato que merece atención de los tomadores de decisión dominicanos aparece en otro lugar del proyecto: de 429 sitios web analizados para incorporación al corpus, apenas 125 sobrevivieron la auditoría de licencias. Menos de un tercio. Esa cifra describe con precisión el estado de la infraestructura informacional latinoamericana. Existe material, existen instituciones dispuestas a compartirlo y existe capacidad técnica para procesarlo. Lo que escasea es claridad jurídica sobre qué puede usarse, bajo qué condiciones y con qué trazabilidad. El equipo de LatamGPT resolvió el problema del modo más costoso disponible: quince…