Aprendiendo Tsotsil en tiempos del Big Data:
Se dice que las lenguas mexicanas han sido poco documetadas, pero existiendo tanto trabajo de lingüistas y antropólogos no vale la pena batallar inventando el hilo negro...voy a intentar aprender a usar todos los recursos técnicos disponibles para aprender la lengua de la manera más eficiente posible...
Aquí voy a ir dejando una bitácora de los métodos y materiales que voy descubriendo en el camino de aprender idiomas...
WordClouds & Frequency Lists:
Comencé con los PDFs y audios del proyecto Nuestras Raíces y después de escuchar uno de los capítulos mientras leía el texto decidí comenzar el proyecto de análisis estadístico del texto.
Primeramente usé el Hermetic Word Frequency Counter para entender el proceso, porque la versión gratuita elimina información para que pagues.
También conseguí un script de Phyton para sacar las listas de palabras frecuentes para comparar con los resultados de Hermetic.
Ambas cosas las tenía desde que estaba queriendo aprender chino con unos videos de tecnología en youTube que tenían subtítulos en inglés y que usaba para buscar las palabras más relevantes.
Esta vez use el sitio gratuito de WordClouds, que por cierto puede leer los PDFs directamente y también tiene una versión en español. Ahí pude hacer directamente la nube con el símbolo del glifo y además también exportar la lista de frecuencias en formato CSV y ahí mismo usar otra de sus aplicaciones para hacer la gráfica de frecuencia.
Subí ambas gráficas a mi sitio de Mayista Amateur pero salen recortadas. Aunque por lo pronto es lo que hay ...luego voy a formatearlas o a poner un link para verlas.
Trabajo Pendiente:
1. Tengo que buscar textos más grandes y de diferentes estilos para completar el corpus, o ver si algún grupo de investigadores ya tiene uno.
2. Comparar las listas de frecuencias que produce cada software. porque cada algoritmo cambia según si acepta apóstrofes guiones y palabras de tres letras o menos.
Estuve tratando de corregir el archivo de Hermetic con mi script de Phyton pero es mucho trabajo. Es mejor usar el CSV de WordCloud. pero uno nunca sabe cuánto tiempo van a ser gratis las cosas.
3. Hacer una regresión estadística para sacar los exponentes o grafícar en escalas logarítmicas para comparar con otras lenguas como aparece en el artículo de Wikipedia.
4. Otro tema interesante son las palabras comunes. El TagCloud me deja bajar los archivos. Tiene 307 palabras para el español y 516 para el inglés, osea que necesita pulirse todavía. Por su parte Hermetic usa 269 y 256 respectivamente.
Felix me dijo que tenía una lista de 400 palabras que le había pasado kiel. Si tiene las traducciones, me servirían mucho para aprender Tsotsil.
Comentarios
Publicar un comentario