MODELOS
COPA lanza arm-gemma-e4b: modelo armenio de 9B con datos y receta de entrenamiento abiertos
El equipo COPA ha publicado arm-gemma-e4b, un modelo base armenio de 9.000 millones de parámetros, junto con su código, receta y datos completos: ArmWeb (4,37 millones de noticias; ~3,3 mil millones de tokens) y ArmSTEM (372.907 problemas STEM verificados). Es auditable y reproducible, pero no está listo para chat sin afinado y salvaguardas.
Qué ha ocurrido
El equipo de COPA ha publicado arm-gemma-e4b, una adaptación armenia de 9B de Gemma-4-E4B, entrenada con 10.000 millones de tokens adicionales y liberada junto con el código y la receta completa. El paquete aporta ArmWeb (4,37 M de documentos; ≈3,3 mil M de tokens, con metadatos de procedencia) y ArmSTEM (372.907 ejercicios paralelos de matemáticas y ciencias, muchos con solución paso a paso). Según COPA, es el primer LLM armenio abierto con datos y receta íntegros y marca la media más alta entre los modelos abiertos que evaluó. La mezcla final fue 69% noticias, 6% STEM (hy/en), 20% web en inglés y 5% código. La inclusión del 6% de STEM resultó crítica: con lr=3e-5 elevó Belebele-hy a 0,716 frente a 0,550 solo con noticias, y un ensayo con lr=1e-4 cayó a 0,407 desde 0,619 del base. En su suite de seis tareas, el modelo promedió 0,500 (base 0,477; ArmenianGPT-1.0-3B 0,471; HyGPT-10b 0,436). El repositorio publica recetas, configuraciones y semillas para reproducir los resultados.
Qué significa para creadores
Para creadores que trabajen en armenio o investiguen flujos de IA, este lanzamiento prioriza trazabilidad: puedes inspeccionar y reutilizar el pipeline de corpus, traducción, verificación y preentrenamiento para afinar tus propios modelos o adaptarlo a otro idioma. Es un modelo base, sin instrucción ni seguridad: no sirve aún como chatbot listo para público; requiere afinado supervisado, evaluación y salvaguardas. El sesgo de un corpus dominado por noticias implica tono formal y cobertura temática limitada fuera de STEM; conviene añadir datos conversacionales y de dominio. Atención a licencias: ArmWeb se distribuye como compilación ODC-BY 1.0 pero los artículos originales mantienen derechos de los editores; ArmSTEM hereda licencias de origen; el modelo queda bajo los términos de Gemma.
Fuente y contexto
COPA detalló el lanzamiento en un artículo de comunidad en Hugging Face el 4 de septiembre, tras publicar el paper el 3 de septiembre. ArmWeb procede de 15 años de rastreo (2011–2026) de sitios de noticias armenios e incluye desduplicación, particiones cronológicas y metadatos por documento; su análisis de contaminación detectó 3,3% antes de decontaminación, por debajo de CulturaX-hy (7,9%), HPLT-v2-hy (10,9%) y FineWeb-2-hy (17,4%). El código abierto cubre corpus, traducción/verificación, recetas de preentrenamiento continuo y evaluación. COPA planea una versión instruccional y más problemas de matemáticas de competición; por ahora ofrece una base pública para estudiar cómo los datos y el entrenamiento afectan a modelos en armenio.
