Согласно мониторингу 1M AI News, SWE-rebench — это реальный бенчмарк, который ежемесячно извлекает новые задачи по программной инженерии (issues + PR) с GitHub и тестирует модели в режиме реального времени, при этом модели не могут заранее оптимизировать ответы под конкретные задачи. 23 марта Ибрагим опубликовал обновление рейтинга, отменив ранее демонстрационные примеры и ограничение в 80 шагов, а также добавил вспомогательные оценочные задания.
Последний топ-10 рейтинга:
Открытая модель Ипсур AI GLM-5 (под лицензией MIT) с результатом 62,8% занимает третье место и является самой высокой среди открытых моделей в списке. В топ-10 представлены четыре китайские модели: кроме GLM-5, это DeepSeek-V3.2 (шестое место), Qwen3.5-397B-A17B от Alibaba (девятое) и Step-3.5-Flash (десятое). Руководитель глобального направления Z.ai Ицзюсянь Ли отметил, что при последнем обновлении SWE-rebench все китайские модели оказались за пределами топ-10, что вызвало критику за «benchmaxing» (засчетное увеличение баллов).