Младшая модель обыграла старших: как Claude Sonnet 5.5 победил Opus 5.5 и Fable 5.1 в пошаговой стратегии

Habr ·

Младшая модель обыграла старших: как Claude Sonnet 5.5 победил Opus 5.5 и Fable 5.1 в пошаговой стр…

Мы посадили модели Claude играть друг против друга в пошаговую стратегию, где нужно строить экономику, воевать, договариваться с соседями и решать, когда договор пора нарушить. Хотели понять две вещи: как топовые языковые модели справляются с такой игрой и совпадёт ли расстановка сил за игровым столом с той, что показывают общепризнанные бенчмарки. Я разработчик «Стратегикона» , пошаговой онлайн-стратегии на гексах. С конца августа по начало октября мы провели серию партий LLM-агентов между собой . Здесь — методика, две партии, ограничения эксперимента и мысль, к которой нас это привело: из игрового движка может получиться бенчмарк для способностей LLM в целом. Читать разбор

Мы посадили модели Claude играть друг против друга в пошаговую стратегию, где нужно строить экономику, воевать, договариваться с соседями и решать, когда договор пора нарушить. Хотели понять две вещи: как топовые языковые модели справляются с такой игрой и совпадёт ли расстановка сил за игровым столом с той, что показывают общепризнанные бенчмарки. Я разработчик «Стратегикона» , пошаговой онлайн-стратегии на гексах. С конца августа по начало октября мы провели серию партий LLM-агентов между собой . Здесь — методика, две партии, ограничения эксперимента и мысль, к которой нас это привело: из игрового движка может получиться бенчмарк для способностей LLM в целом. Читать разбор

Источник: Habr