Публикация Hugging Face от 1 октября описывает переработанную систему обучения mixture-of-experts. Авторы заявляют масштабирование обучения таких моделей до триллиона параметров с сохранением вычислительной эффективности.

Вместе с релизом приложены технический отчёт, код и интерактивная демонстрация. Практический эффект касается исследователей и инженеров, обучающих собственные MoE-модели: часть инфраструктуры открыта вместе с кодом.