Skip to content

RL from textual feedback #1

Description

@zhujiem
  • [Arxiv'26] Reinforcement Learning via Self-Distillation

    GRPO只能采用scalar reward,信号很稀疏,浪费了一些高质量的textual feedback,比如跑的test cases或错误信息。本文提出SDPO,基于自蒸馏策略优化,即通过输入prompt+feedback作为teacher,只输入prompt作为student,跑OPD loss。其中feedback可以是自己生成的正确答案及当前的执行错误。不同之处是SDPO需要考虑对teacher进行EMA/inital加权,避免训练不稳定(漂移)。

  • Text2grad: Reinforcement learning from natural language feedback.
  • Optimizing generative ai by backpropagating language model feedback
  • From words to rewards: Leveraging natural language for reinforcement learning
  • Feedback descent: Open-ended text optimization via pairwise comparison
  • Language models can learn from verbal feedback without scalar rewards.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions