Армин Ронахер: Что такое рассу... Заметка
Planet Python на русском

Армин Ронахер: Что такое рассуждение

Недавняя статья раскрыла, как извлекать следы рассуждений из моделей с закрытым весом, вызвав обсуждение в сети. Следы рассуждений обычно скрыты от пользователей, в отличие от моделей с открытым весом, где они видны. Эти следы — это, по сути, текст, который модели обучаются выводить на черновик перед своим окончательным ответом. Специальные токены разграничивают эти разделы рассуждений, а парсер направляет этот контент в отдельный поток. Для закрытых моделей этот промежуточный текст, вероятно, будет отредактирован или обобщен. Объем рассуждений, выполняемых моделью, определяется ее системным промптом, а не сэмплированием. Например, он может быть установлен на "низкий" или "Абсолютный максимум без разрешенных сокращений". Модели обучаются держать эту черновую работу отдельно от канала окончательного ответа. Обман модели, заставляющий ее поверить, что она находится в канале рассуждений, может привести к утечке этих следов. Старые модели, когда мышление было отключено, иногда записывали свои мысли в нулевое устройство. В некоторых случаях единственным особым поведением является способность модели воздерживаться от мышления. Этого можно добиться, отключив обычные механизмы мышления модели. Некоторые API для инференса могут предварительно заполнять токены для управления рассуждениями, что можно обойти с помощью пользовательских инструментов, особенно когда отключены нативные рассуждения. Автор в шутку столкнулся с контент-фильтрами, пытаясь использовать конкретную модель для проверки грамматики этого самого блога.
CdXz5zHNQW_KvYYV2hcVr.png