LLMSignal #003 — А что если агенту вообще не нужно генерировать текст, чтобы выбрать следующее действие
Habr ·

Исследователи Stanford Hazy Research представили CLM-8B - Contrastive Language Model , открытую 8B-модель для быстрых решений внутри агентных систем. В отличие от обычной LLM, которая последовательно генерирует токены ответа, CLM получает состояние среды и набор возможных действий, после чего оценивает, какое действие лучше соответствует текущему состоянию. Код и модели опубликованы открыто, а базовая реализация построена вокруг Qwen3-8B. Идея меняет саму вычислительную задачу. Пусть агент находится в состоянии s и может выполнить одно из действий a₁, a₂, ..., aₙ ; обычная генеративная модель должна сформировать текстовое представление решения токен за токеном, тогда как CLM вычисляет вектор состояния f(s) и векторы действий g(aᵢ) , после чего сравнивает их скалярным произведением. Упрощённо решение можно записать как a* = argmaxᵢ f(s)·g(aᵢ) : чем ближе представления состояния и действия в обученном пространстве признаков, тем выше вероятность выбора этого действия. Для обучения используется контрастивная функция потерь InfoNCE. Правильная пара «состояние - действие» притягивается в пространстве представлений, а неправильные действия отталкиваются; математически вероятность правильного действия можно представить как P(aᵢ|s) = exp(sim(s,aᵢ)/τ) / Σⱼ exp(sim(s,aⱼ)/τ) , где τ задаёт резкость распределения. Если доступно только одно действие, такая классификация почти бессмысленна, но при сотнях или тысячах повторно используемых действий преимущество становится существенным: их векторы можно вычислить один раз и затем кэшировать. Читать далее
Исследователи Stanford Hazy Research представили CLM-8B - Contrastive Language Model , открытую 8B-модель для быстрых решений внутри агентных систем. В отличие от обычной LLM, которая последовательно генерирует токены ответа, CLM получает состояние среды и набор возможных действий, после чего оценивает, какое действие лучше соответствует текущему состоянию. Код и модели опубликованы открыто, а базовая реализация построена вокруг Qwen3-8B. Идея меняет саму вычислительную задачу. Пусть агент находится в состоянии s и может выполнить одно из действий a₁, a₂, ..., aₙ ; обычная генеративная модель должна сформировать текстовое представление решения токен за токеном, тогда как CLM вычисляет вектор состояния f(s) и векторы действий g(aᵢ) , после чего сравнивает их скалярным произведением. Упрощённо решение можно записать как a* = argmaxᵢ f(s)·g(aᵢ) : чем ближе представления состояния и действия в обученном пространстве признаков, тем выше вероятность выбора этого действия. Для обучения используется контрастивная функция потерь InfoNCE. Правильная пара «состояние - действие» притягивается в пространстве представлений, а неправильные действия отталкиваются; математически вероятность правильного действия можно представить как P(aᵢ|s) = exp(sim(s,aᵢ)/τ) / Σⱼ exp(sim(s,aⱼ)/τ) , где τ задаёт резкость распределения. Если доступно только одно действие, такая классификация почти бессмысленна, но при сотнях или тысячах повторно используемых действий преимущество становится существенным: их векторы можно вычислить один раз и затем кэшировать. Читать далее