В r/LocalLLaMA пользователь прогнал Kimi-K3 через 34 однопроходных промпта на генерацию HTML и оценил результаты — скриншоты и гифки — с помощью Sonnet в роли судьи. По его выводу, Kimi-K3 выглядит лучше Opus 4.8. Пользовательский бенчмарк: подтверждены сам тест и оценка автора.
Сравнение идёт на реальных задачах генерации интерфейсов, вывод «лучше» стоит читать как сигнал из комьюнити. Единичный прогон с моделью-судьёй, так что выбор модели разумно проверять на собственных задачах.