<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Grupo de Investigación en Lenguas, Territorio e Inteligencia Artificial</title><link>https://giltia.github.io/es/</link><atom:link href="https://giltia.github.io/es/index.xml" rel="self" type="application/rss+xml"/><description>Grupo de Investigación en Lenguas, Territorio e Inteligencia Artificial</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>es</language><lastBuildDate>Mon, 01 Jan 2024 00:00:00 +0000</lastBuildDate><image><url>https://giltia.github.io/media/icon_hu_4650b61b0e05ba9e.png</url><title>Grupo de Investigación en Lenguas, Territorio e Inteligencia Artificial</title><link>https://giltia.github.io/es/</link></image><item><title>Diario de Yucatán: Traductor en maya</title><link>https://giltia.github.io/es/post/traductor-en-maya-diario-yucatan/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/traductor-en-maya-diario-yucatan/</guid><description>&lt;p&gt;&lt;strong&gt;Perfiles de nuestra gente&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="traductor-en-maya"&gt;Traductor en maya&lt;/h2&gt;
&lt;h3 id="buscan-integrar-la-lengua-regional-a-la-tecnología"&gt;Buscan integrar la lengua regional a la tecnología&lt;/h3&gt;
&lt;p&gt;La investigación desarrollada en Yucatán para acercar la lengua maya a las nuevas tecnologías llegó a uno de los escenarios académicos más importantes del mundo en materia de inteligencia artificial.&lt;/p&gt;
&lt;p&gt;El doctorante del CentroGeo, Jaziel Aarón Carballo-Tadeo, representó a México en la 16.ª edición de la Escuela de Verano de Aprendizaje Automático de Lisboa (LxMLS 2026), donde presentó un proyecto que busca enseñar a las computadoras a comprender y transcribir el maya yucateco.&lt;/p&gt;
&lt;p&gt;El objetivo de la investigación de Carballo-Tadeo fue reducir la brecha tecnológica que enfrentan los hablantes de lenguas originarias, ya que actualmente los sistemas de reconocimiento de voz funcionan de manera eficiente en idiomas como el español o el inglés, pero prácticamente no reconocen el maya yucateco.&lt;/p&gt;
&lt;p&gt;Él mencionó que la investigación propone un método para el mejoramiento de la precisión con la que las computadoras transcriben la voz de los hablantes de esta lengua, mediante el uso de diccionarios especializados y las reglas oficiales de escritura del maya.&lt;/p&gt;
&lt;p&gt;Según destacó, haber sido admitido a la LxMLS 2026 representa un importante reconocimiento, porque se trata de una convocatoria internacional altamente competitiva que reúne cada año a estudiantes e investigadores de distintos países, así como a especialistas de instituciones de prestigio como la Universidad de Washington, Carnegie Mellon y el Allen Institute for AI.&lt;/p&gt;
&lt;p&gt;Además de ser de los seleccionados para participar en este encuentro académico, su investigación fue una de las 24 seleccionadas para presentarse en formato de póster, lo que le permitió compartir ante la comunidad científica internacional un proyecto desarrollado desde CentroGeo sede Mérida y enfocado en atender las necesidades tecnológicas de la lengua maya.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Idioma invisible&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;El doctorante del CentroGeo, Jaziel Carballo-Tadeo, indicó que el idioma maya sigue siendo invisible para la mayoría de los asistentes virtuales, teléfonos inteligentes y plataformas de reconocimiento de voz.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Presencia limitada&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Además, subrayó que la presencia de investigadores latinoamericanos en este tipo de encuentros internacionales, como la Escuela de Verano de Aprendizaje Automático de Lisboa, aún es limitada.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Paso importante&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;La participación de una investigación centrada en enseñar a las computadoras a comprender y transcribir el maya yucateco representa un paso importante para posicionar al idioma dentro del desarrollo de las tecnologías del lenguaje y fortalecer futuras colaboraciones científicas internacionales.&lt;/p&gt;
&lt;p&gt;El investigador dijo que este proyecto fue realizado en colaboración con el doctor Alejandro Molina-Villegas, responsable del desarrollo de tecnologías lingüísticas en CentroGeo Mérida, con el propósito de impulsar herramientas que permitan la inclusión digital de las lenguas indígenas.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Nota de Ilse Noh Canché, publicada en Diario de Yucatán el 17 de agosto de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>TecNM Campus Mérida: orgullo por la investigación en IA y lengua maya de un egresado</title><link>https://giltia.github.io/es/post/tecnm-campus-merida-ia-lengua-maya/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/tecnm-campus-merida-ia-lengua-maya/</guid><description>&lt;p&gt;El Tecnológico Nacional de México (TecNM), Campus Mérida, publicó en su página de Facebook un mensaje de reconocimiento a Jaziel Aarón Carballo Tadeo, egresado de Ingeniería en Sistemas Computacionales, por impulsar el desarrollo de tecnologías de inteligencia artificial capaces de reconocer y procesar la lengua maya yucateca, trabajo presentado en la 16.ª Escuela de Verano de Aprendizaje Automático de Lisboa (LxMLS 2026), en Portugal. La institución subrayó que el proyecto combina innovación tecnológica con la preservación lingüística y el patrimonio cultural.&lt;/p&gt;
&lt;div style="text-align:center;"&gt;
&lt;iframe src="https://www.facebook.com/plugins/post.php?href=https%3A%2F%2Fwww.facebook.com%2FTecNMCampusMerida%2Fposts%2Fpfbid0VnE9rjJUKpb36Dbmxm7DY9zNgCgW8RAj5GbXB4Hr6veEyEKtgEcELMUshqSqQp4Sl&amp;show_text=true&amp;width=500" width="500" height="709" style="border:none;overflow:hidden;max-width:100%;" scrolling="no" frameborder="0" allowfullscreen="true" allow="autoplay; clipboard-write; encrypted-media; picture-in-picture; web-share"&gt;&lt;/iframe&gt;
&lt;/div&gt;
&lt;p&gt;&lt;em&gt;Publicación de TecNM Campus Mérida en Facebook, 16 de agosto de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>TeleYucatán: Entrevista sobre LxMLS 2026 y el proyecto de lengua maya</title><link>https://giltia.github.io/es/post/teleyucatan-entrevista-lxmls-2026/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/teleyucatan-entrevista-lxmls-2026/</guid><description>&lt;p&gt;Entrevista en vivo con Jaziel Carballo Tadeo sobre su participación en la 16.ª Escuela de Verano de Aprendizaje Automático de Lisboa (LxMLS 2026), en la que habló de cómo llegó a Lisboa, Portugal, y en qué consiste su proyecto de investigación para que las tecnologías de inteligencia artificial reconozcan y procesen la lengua maya.&lt;/p&gt;
&lt;div style="position: relative; padding-bottom: 56.25%; height: 0; overflow: hidden;"&gt;
&lt;iframe allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share; fullscreen" loading="eager" referrerpolicy="strict-origin-when-cross-origin" src="https://www.youtube.com/embed/GQsOUYaQ0u8?autoplay=0&amp;amp;controls=1&amp;amp;end=0&amp;amp;loop=0&amp;amp;mute=0&amp;amp;start=2123" style="position: absolute; top: 0; left: 0; width: 100%; height: 100%; border:0;" title="YouTube video"&gt;&lt;/iframe&gt;
&lt;/div&gt;
&lt;p&gt;&lt;em&gt;Entrevista transmitida en vivo por TeleYucatán, agosto de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>TV Azteca: El investigador yucateco Jaziel Carballo trabaja para que la IA reconozca, transcriba y traduzca la lengua maya</title><link>https://giltia.github.io/es/post/tvazteca-hechos-meridiano-lengua-maya/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/tvazteca-hechos-meridiano-lengua-maya/</guid><description>&lt;p&gt;&lt;strong&gt;#HechosMeridianoYucatán&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;El investigador yucateco Jaziel Carballo trabaja en un proyecto para que la Inteligencia Artificial reconozca, transcriba y traduzca con precisión la lengua maya, buscando cerrar la brecha digital y preservar esta lengua ancestral.&lt;/p&gt;
&lt;p&gt;Entrevista en video con Jaziel Carballo, identificado en el segmento como &amp;ldquo;Doctorante Ciencias en Información Geoespacial&amp;rdquo;.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Segmento de TV Azteca Yucatán, transmitido el 14 de agosto de 2026 a las 22:00 h.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>PuntoMedio: Buscan que la inteligencia artificial reconozca y procese la lengua maya</title><link>https://giltia.github.io/es/post/puntomedio-ia-reconozca-lengua-maya/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/puntomedio-ia-reconozca-lengua-maya/</guid><description>&lt;p&gt;&lt;strong&gt;Propuesta&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="buscan-que-la-inteligencia-artificial-reconozca-y-procese-la-lengua-maya"&gt;Buscan que la inteligencia artificial reconozca y procese la lengua maya&lt;/h2&gt;
&lt;p&gt;&lt;em&gt;Texto y fotos: Andrea Segura&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;El maya yucateco llegó a un escenario internacional de investigación en inteligencia artificial (IA) de la mano de Jaziel Aarón Carballo Tadeo, quien presentó en Lisboa, Portugal, una propuesta para avanzar en el desarrollo de tecnologías capaces de procesar y reconocer esta lengua originaria.&lt;/p&gt;
&lt;p&gt;Carballo Tadeo, estudiante del Doctorado en Ciencias de Información Geoespacial del CentroGeo, participó en la 16ª Escuela de Verano de Aprendizaje Automático de Lisboa (LxMLS 2026), organizada por el Instituto Superior Técnico de la Universidad de Lisboa en colaboración con ELLIS, red europea dedicada a la investigación en IA.&lt;/p&gt;
&lt;p&gt;De acuerdo con la información proporcionada, alrededor de 500 personas de más de 20 países solicitaron ingresar al programa, de las cuales únicamente 135 fueron seleccionadas. El investigador yucateco fue el único mexicano admitido. Además de participar en el programa académico, su investigación se centró particularmente en tecnologías de voz y reconocimiento del lenguaje. Para ello, la propuesta utiliza diccionarios y las reglas oficiales de escritura de la lengua como parte de los recursos para desarrollar modelos que permitan a las tecnologías procesarla.&lt;/p&gt;
&lt;p&gt;El proyecto busca contribuir a reducir la brecha tecnológica que enfrentan las lenguas originarias frente a idiomas con mayor representación en sistemas de inteligencia artificial, con potenciales aplicaciones en herramientas de reconocimiento de voz, asistentes digitales y otras tecnologías de procesamiento del lenguaje.&lt;/p&gt;
&lt;p&gt;Carballo Tadeo, egresado del Instituto Tecnológico de Mérida, llevó así una investigación centrada en el patrimonio lingüístico de la península de Yucatán a uno de los espacios internacionales de formación científica en inteligencia artificial.&lt;/p&gt;
&lt;p&gt;La participación internacional del investigador contó con el respaldo de la Secretaría de Ciencias, Humanidades, Tecnología e Innovación de Yucatán (Secihti), encabezada por Mirna Manzanilla Romero, institución que apoyó las gestiones necesarias para facilitar su traslado y participación en el encuentro realizado en Portugal.&lt;/p&gt;
&lt;p&gt;La propuesta plantea que el desarrollo de nuevas tecnologías no solo considere los idiomas de mayor presencia internacional, sino que también incorpore las lenguas originarias, con el objetivo de ampliar su presencia en el entorno digital y contribuir a su preservación y uso en nuevas herramientas tecnológicas.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Datos a destacar:&lt;/strong&gt; Jaziel Aarón Carballo Tadeo presentó en Portugal una propuesta para avanzar en el desarrollo de tecnologías capaces de procesar y reconocer la lengua maya.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Nota de Andrea Segura, publicada en PuntoMedio el 11 de agosto de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>Radio Fórmula: ¡El maya yucateco llega a la inteligencia artificial!</title><link>https://giltia.github.io/es/post/radio-formula-ia-lengua-maya/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/radio-formula-ia-lengua-maya/</guid><description>&lt;p&gt;&lt;strong&gt;Radio Fórmula Yucatán&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;🇲🇽🤖 ¡El maya yucateco llega a la inteligencia artificial!&lt;/p&gt;
&lt;p&gt;El investigador yucateco Jaziel Aarón Carballo Tadeo llevó hasta Lisboa, Portugal, una investigación que busca que las computadoras puedan reconocer y procesar la lengua maya.&lt;/p&gt;
&lt;p&gt;📡 Su trabajo fue seleccionado entre solo 24 investigaciones para ser presentado en la 16.ª Escuela de Verano de Aprendizaje Automático de Lisboa (LxMLS 2026), uno de los encuentros de IA más destacados de Europa.&lt;/p&gt;
&lt;p&gt;🌎 Con más de 774 mil hablantes en la Península de Yucatán, el proyecto busca que la lengua maya también tenga presencia en el futuro tecnológico y no quede fuera de herramientas como asistentes virtuales y sistemas de reconocimiento de voz.&lt;/p&gt;
&lt;p&gt;🇲🇽 Desde Yucatán, la investigación busca abrir camino para que una de las lenguas originarias más vivas de México también tenga un lugar en la era digital.&lt;/p&gt;
&lt;p&gt;👏 ¡Orgullo yucateco que llega hasta Lisboa! @jazielcarballo&lt;/p&gt;
&lt;p&gt;#OrgulloYucateco #FormulaNoticias #lxmls2026&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Publicación de Radio Fórmula Yucatán en Facebook, agosto de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>Telesur: Investigador yucateco lleva el maya yucateco a Lisboa</title><link>https://giltia.github.io/es/post/telesur-ia-entendera-lengua-maya/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/telesur-ia-entendera-lengua-maya/</guid><description>&lt;p&gt;&lt;strong&gt;IA entenderá — Lengua maya gracias a investigador&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Investigador yucateco lleva el maya yucateco a Lisboa: propone método para que la inteligencia artificial entienda la lengua.&lt;/p&gt;
&lt;p&gt;Más de 774 mil hablantes de maya yucateco en la Península enfrentan una paradoja cotidiana: mientras cualquier teléfono reconoce el inglés, el español o el francés con facilidad, la lengua originaria más viva de la región es prácticamente invisible para la tecnología. Ningún asistente virtual la entiende. Ninguna aplicación la reconoce. Una investigación presentada en Lisboa, Portugal, propone un método para comenzar a cerrar esa brecha.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Publicación de Telesur (@telesuryuc) en redes sociales, agosto de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>LxMLS 2026: 16.ª Escuela de Aprendizaje Automático de Lisboa</title><link>https://giltia.github.io/es/event/lxmls-2026/</link><pubDate>Mon, 20 Jul 2026 09:00:00 +0000</pubDate><guid>https://giltia.github.io/es/event/lxmls-2026/</guid><description>&lt;p&gt;La &lt;a href="https://lxmls.github.io/2026/" target="_blank" rel="noopener"&gt;Lisbon Machine Learning School (LxMLS)&lt;/a&gt; celebra en 2026 su decimosexta edición en el Instituto Superior Técnico de Lisboa, Portugal, del 20 al 25 de julio. Es una de las escuelas de verano de aprendizaje automático más reconocidas de Europa y forma parte de la red europea ELLIS.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Jaziel A. Carballo Tadeo fue aceptado para participar en esta edición.&lt;/strong&gt; La escuela combina clases magistrales matutinas con laboratorios prácticos por la tarde, presentaciones de pósteres y charlas invitadas, cubriendo temas que van de los modelos lineales a los transformers, la causalidad y los modelos visión-lenguaje. Esta formación fortalece directamente la investigación del grupo en tecnologías del lenguaje para el maya yucateco.&lt;/p&gt;</description></item><item><title>Whisper-LM con léxico maya: corrección de transcripciones ASR de maya yucateco usando Gemini y un diccionario como referencia</title><link>https://giltia.github.io/es/publication/whisper-lm-yua-lexicon-rag/</link><pubDate>Thu, 09 Jul 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/publication/whisper-lm-yua-lexicon-rag/</guid><description>&lt;h2 id="qué-problema-resuelve-este-cuaderno"&gt;¿Qué problema resuelve este cuaderno?&lt;/h2&gt;
&lt;p&gt;Whisper, el sistema de reconocimiento automático de voz (ASR) de OpenAI, no incluye el maya yucateco entre sus lenguas soportadas. Al transcribir audio en maya, el modelo produce salidas muy ruidosas y con frecuencia &amp;ldquo;detecta&amp;rdquo; la lengua equivocada: en nuestros datos, segmentos en maya fueron etiquetados como español, inglés e incluso japonés. Este cuaderno explora una pregunta práctica: &lt;strong&gt;¿cuánto puede mejorar un modelo de lenguaje grande (LLM) la salida de Whisper si le damos un léxico maya como referencia?&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="arquitectura-del-pipeline"&gt;Arquitectura del pipeline&lt;/h2&gt;
&lt;p&gt;El flujo completo es:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Audio → Whisper (turbo) → Normalizador de reglas → Gemini + léxico → Normalizador → Evaluación (CER/WER)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="1-datos-de-entrada"&gt;1. Datos de entrada&lt;/h3&gt;
&lt;p&gt;Se parte de un CSV (&lt;code&gt;transcription_results41Turbo.csv&lt;/code&gt;) con 1,010 segmentos de audio ya transcritos por Whisper turbo. Cada fila incluye la transcripción de referencia hecha por humanos (&lt;code&gt;original_transcription&lt;/code&gt;), la predicción de Whisper (&lt;code&gt;whisper_prediction&lt;/code&gt;), la lengua detectada y métricas iniciales (chrF, WER, CER).&lt;/p&gt;
&lt;h3 id="2-léxico-maya-como-referencia-componente-rag"&gt;2. Léxico maya como referencia (componente RAG)&lt;/h3&gt;
&lt;p&gt;Se carga un diccionario maya–español en formato TSV (&lt;code&gt;yua_dictionary.tsv&lt;/code&gt;) con &lt;strong&gt;2,988 entradas&lt;/strong&gt;. Una clase &lt;code&gt;YuaLexicon&lt;/code&gt; ofrece búsqueda exacta y búsqueda difusa (&lt;em&gt;fuzzy matching&lt;/em&gt; con &lt;code&gt;difflib.get_close_matches&lt;/code&gt;), lo que permite encontrar la palabra maya válida más cercana a un token mal transcrito.&lt;/p&gt;
&lt;h3 id="3-normalizador-ortográfico-basado-en-reglas"&gt;3. Normalizador ortográfico basado en reglas&lt;/h3&gt;
&lt;p&gt;Antes y después de pasar por el LLM, el texto se normaliza con reglas lingüísticas del maya yucateco tomadas de una gramática de referencia:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Reglas morfológicas de raíz&lt;/strong&gt;: por ejemplo, &lt;em&gt;bin&lt;/em&gt; (ir) con raíz irregular &lt;em&gt;xi&amp;rsquo;&lt;/em&gt; en futuro indefinido intransitivo, o posicionales como &lt;em&gt;chil&lt;/em&gt;, &lt;em&gt;kul&lt;/em&gt; y &lt;em&gt;wa&amp;rsquo;al&lt;/em&gt; que pierden la &lt;em&gt;l&lt;/em&gt; antes de &lt;em&gt;-tal&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Patrones regulares &amp;ldquo;seguros&amp;rdquo;&lt;/strong&gt;: &lt;em&gt;bins&lt;/em&gt; → &lt;em&gt;bis&lt;/em&gt;, &lt;em&gt;taals&lt;/em&gt; → &lt;em&gt;taas&lt;/em&gt;, y verbos que cambian la &lt;em&gt;b&lt;/em&gt; final por estructura con saltillo (&lt;em&gt;jáalk&amp;rsquo;ab&lt;/em&gt; → &lt;em&gt;jáalk&amp;rsquo;a&amp;rsquo;a&lt;/em&gt;).&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Verificación contra el léxico&lt;/strong&gt;: si la forma normalizada existe en el diccionario, se conserva; si la original era válida, se respeta.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="4-corrección-con-gemini-whisper-lm"&gt;4. Corrección con Gemini (Whisper-LM)&lt;/h3&gt;
&lt;p&gt;Cada transcripción normalizada se envía a &lt;strong&gt;Gemini 2.0 Flash&lt;/strong&gt; con un prompt que incluye hasta 500 palabras del léxico maya como referencia ortográfica. Las instrucciones clave del prompt son: corregir respetando la gramática y ortografía estándar del maya yucateco, &lt;strong&gt;no traducir al español&lt;/strong&gt;, elegir la opción más probable según el léxico y devolver únicamente el texto corregido.&lt;/p&gt;
&lt;h3 id="5-evaluación"&gt;5. Evaluación&lt;/h3&gt;
&lt;p&gt;Se calcula la tasa de error por carácter (CER) y por palabra (WER) con &lt;code&gt;editdistance&lt;/code&gt;, comparando contra la transcripción humana de referencia:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Métrica&lt;/th&gt;
&lt;th&gt;Whisper turbo&lt;/th&gt;
&lt;th&gt;Whisper-LM (este pipeline)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;CER medio&lt;/td&gt;
&lt;td&gt;1.0743&lt;/td&gt;
&lt;td&gt;1.0725&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;WER medio&lt;/td&gt;
&lt;td&gt;1.1796&lt;/td&gt;
&lt;td&gt;1.1692&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="qué-aprendimos"&gt;¿Qué aprendimos?&lt;/h2&gt;
&lt;p&gt;La mejora es &lt;strong&gt;marginal&lt;/strong&gt;: el posprocesamiento con LLM y léxico recupera algo de forma ortográfica, pero no puede reconstruir información que el modelo acústico nunca capturó. Con valores de CER/WER superiores a 1.0, la salida de Whisper está tan alejada de la referencia que la corrección textual tiene poco material con el que trabajar. La conclusión práctica es que, para el maya yucateco, &lt;strong&gt;el cuello de botella está en el modelo acústico&lt;/strong&gt;: se necesita ajuste fino (&lt;em&gt;fine-tuning&lt;/em&gt;) de Whisper con datos de habla maya, y no solo corrección posterior.&lt;/p&gt;
&lt;h2 id="próximos-pasos"&gt;Próximos pasos&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Ajuste fino de Whisper con audio transcrito en maya yucateco.&lt;/li&gt;
&lt;li&gt;Ampliar las reglas ortográficas (&lt;code&gt;ORTHO_RULES&lt;/code&gt;) con los errores recurrentes observados en las transcripciones.&lt;/li&gt;
&lt;li&gt;Ampliar el léxico y experimentar con recuperación selectiva (enviar al prompt solo las entradas relevantes para cada segmento, en lugar de una lista fija).&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="acceso-al-cuaderno"&gt;Acceso al cuaderno&lt;/h2&gt;
&lt;p&gt;Si te interesa el cuaderno de Colab, puedes ponerte en contacto con el autor en &lt;a href="mailto:jaziel.carballo@gmail.com"&gt;jaziel.carballo@gmail.com&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>CentroGeo: presenta el corpus paralelo maya–español YUA-ES-CCC</title><link>https://giltia.github.io/es/post/centrogeo-yua-es-corpus/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/centrogeo-yua-es-corpus/</guid><description>&lt;p&gt;&lt;strong&gt;CentroGeo Centro Público de Investigación&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Presentamos el YUA-ES Communicative Contexts Corpus (YUA-ES-CCC), una colección abierta de 14,332 pares de frases en maya yucateco y español, organizadas en 31 contextos cotidianos: saludos, transporte, conversación cotidiana, familia, comida y más.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Más de 14 mil frases en maya yucateco y español, disponibles como datos abiertos.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Corpus paralelo maya–español (YUA-ES-CCC)&lt;/strong&gt;
Un recurso abierto que impulsa la investigación, la educación y la generación de tecnologías lingüísticas para las lenguas indígenas.&lt;/p&gt;
&lt;p&gt;Conoce más en: cgeo.mx/#d35&lt;/p&gt;
&lt;p&gt;Proyecto desarrollado en colaboración con Sedeculta Yucatán (Secretaría de Ciencias, Humanidades, Tecnología e Innovación).&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;El corpus está descrito en la publicación &lt;a href="https://giltia.github.io/es/publication/yua-es-corpus/"&gt;&lt;em&gt;The YUA-ES Communicative Contexts Corpus&lt;/em&gt;&lt;/a&gt;, disponible como preprint en Research Square.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Publicación de CentroGeo Centro Público de Investigación en Facebook, 1 de julio de 2026.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>The YUA-ES Communicative Contexts Corpus: An Open Parallel Dataset of Everyday Yucatec Maya–Spanish Phrases</title><link>https://giltia.github.io/es/publication/yua-es-corpus/</link><pubDate>Wed, 17 Jun 2026 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/publication/yua-es-corpus/</guid><description/></item><item><title>Generating a Culturally and Linguistically Adapted Word Similarity Benchmark for Yucatec Maya</title><link>https://giltia.github.io/es/publication/maya-word-similarity-benchmark/</link><pubDate>Thu, 25 Sep 2025 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/publication/maya-word-similarity-benchmark/</guid><description/></item><item><title>Findings of the AmericasNLP 2024 Shared Task on the Creation of Educational Materials for Indigenous Languages</title><link>https://giltia.github.io/es/publication/americasnlp-2024-findings/</link><pubDate>Fri, 21 Jun 2024 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/publication/americasnlp-2024-findings/</guid><description/></item><item><title>Mayasoundex: A Phonetically Grounded Algorithm for Information Retrieval in the Maya Language</title><link>https://giltia.github.io/es/publication/mayasoundex/</link><pubDate>Sun, 16 Jun 2024 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/publication/mayasoundex/</guid><description/></item><item><title>GeoInt Difusión: Se podría navegar en maya en la web</title><link>https://giltia.github.io/es/post/geoint-taantsil-navegar-maya-web/</link><pubDate>Mon, 01 Apr 2024 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/post/geoint-taantsil-navegar-maya-web/</guid><description>&lt;p&gt;&lt;strong&gt;Difusión | Noticias&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="se-podría-navegar-en-maya-en-la-web"&gt;Se podría navegar en maya en la web&lt;/h2&gt;
&lt;p&gt;&lt;em&gt;Iván Canul Ek&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;El artículo presenta el proyecto T&amp;rsquo;aantsil, una plataforma de corpus lingüístico para el maya yucateco dirigida por Alejandro Molina-Villegas, investigador del Conahcyt adscrito a CentroGeo.&lt;/p&gt;
&lt;p&gt;La iniciativa busca integrar la lengua maya al espacio digital, permitiendo que sus hablantes accedan a tecnologías disponibles en otros idiomas. T&amp;rsquo;aantsil compila material multimedia de comunidades mayahablantes mediante entrevistas, videos y audios que se transcriben en maya, traducen al español y posteriormente al inglés mediante inteligencia artificial.&lt;/p&gt;
&lt;p&gt;Molina-Villegas señala que &amp;ldquo;la lengua maya está rezagada en el espacio digital con respecto a otras lenguas mejor representadas&amp;rdquo; y destaca que la plataforma preserva la lengua ante su riesgo de desaparición, pues hay cada vez menos hablantes.&lt;/p&gt;
&lt;p&gt;La plataforma, disponible en taantsil.com.mx y desarrollada con César Can Canul, de la Uady, permite búsquedas de palabras en maya con fragmentos de entrevistas, transcripciones y traducciones, incluyendo variantes regionales.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Nota de Iván Canul Ek, publicada en GeoInt Difusión (CentroGeo) en abril de 2024.&lt;/em&gt;&lt;/p&gt;</description></item><item><title>Contacto</title><link>https://giltia.github.io/es/contact/</link><pubDate>Mon, 01 Jan 2024 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/contact/</guid><description/></item><item><title>Equipo</title><link>https://giltia.github.io/es/people/</link><pubDate>Mon, 01 Jan 2024 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/people/</guid><description/></item><item><title>Tour</title><link>https://giltia.github.io/es/tour/</link><pubDate>Mon, 24 Oct 2022 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/tour/</guid><description/></item><item><title/><link>https://giltia.github.io/es/admin/config.yml</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://giltia.github.io/es/admin/config.yml</guid><description/></item></channel></rss>