На блоге Hugging Face опубликованы LFM2.5-Encoders от Liquid AI: энкодеры, оптимизированные для работы с длинным контекстом на обычных процессорах. Заявленная специализация — CPU-инференс для длинных последовательностей.
Если энкодеры действительно дают приемлемую скорость на CPU при длинном контексте, это практический шаг в сторону локального AI без GPU. Для разработчиков self-hosted и edge-решений такая оптимизация может быть полезнее очередного увеличения параметров модели.