La cultura como corpus
Categoría: Molesquina, Innovación

El equipo del Centro Nacional de Inteligencia Artificial de Chile liberó el primer modelo de LatamGPT. Partió de Llama 3.1, un modelo base de 70,000 millones de parámetros, le aplicó preentrenamiento continuo con un corpus latinoamericano, ajustó el resultado con supervisión humana y lo publicó en acceso abierto. Con el corte de datos del 31 de julio de 2025 cierra una ventana. Lo que había entrado hasta entonces —188 millones de documentos, 296,500 millones de tokens, 152 conjuntos de datos provenientes de veinte países— pasó a constituir la materia prima de un modelo de lenguaje entrenado deliberadamente con la memoria de una región. Quince personas produjeron el artefacto. La cifra reveladora del proyecto está en otro lado: de 429 sitios web examinados para incorporación, sobrevivieron 125. Menos de un tercio del material candidato logró atravesar la auditoría de licencias. Esa tasa de supervivencia funciona como termómetro de algo más amplio que un problema de derecho autoral. Describe la resistencia que opone el entorno institucional latinoamericano al flujo de su propia información. Existe materia, existe voluntad de compartirla y existe capacidad para procesarla; el gradien…