Large Language Model (LLM) from scratch. LLMedieval.

En la entrada anterior desarrollamos un ejemplo de clasificación de texto usando redes neuronales. En particular, nuestro objetivo fue determinar si un texto estaba escrito en castellano medieval o no.

En dicho ejercicio estimamos el modelo con textos escritos en castellano medieval desde esta web y textos escritos en castellano moderno provenientes de la iniciativa “Santiago en 100 Palabras”, por tanto, la predicción es parcialmente correcta sólo si son ingresados textos distintos a los usados para el entrenamiento, pero provenientes de estas fuentes. Por el contrario, si ingresamos textos cuya morfología es similar a la del castellano medieval, que no son de la iniciativa “Santiago en 100 Palabras”, y que no han sido escritos en castellano medieval (como textos en portugués), es muy probable que sean erróneamente clasificados como medieval.

Evidentemente, para responder si un texto está escrito en castellano medieval o no, es necesario tener un corpus suficientemente grande, que entre otras cosas, incluya múltiples idiomas. Con esta precisión en mente, presentamos la versión en línea del clasificador: https://pulki.es/medieval/clasificar.php. No obstante, además del clasificador, esta página albergará un proyecto que llamaremos LLMedieval. En la siguiente sección te explicamos de qué se trata.

LLMedieval

LLMedieval será un Large Language Model cuyo principal objetivo es generar texto en castellano medieval. Este proyecto tiene fines estrictamente didácticos, sin embargo, su realización puede ser útil para:

  • Investigación filológica y lingüística
  • Apoyo a edición y transcripción de manuscritos
  • Educación y divulgación
  • Humanidades digitales
  • Recreación histórica y creación de contenido
  • Clasificación y atribución estilística

El proceso se irá datando en https://pulki.es/medieval/. Stay tuned!

José Miguel Muñoz Urra – jmunozu@pulki.es