-
Notifications
You must be signed in to change notification settings - Fork 0
RL from textual feedback #1
Copy link
Copy link
Open
Description
zhujiem
opened on Aug 17, 2026
Issue body actions
- [Arxiv'26] Reinforcement Learning via Self-Distillation
- Text2grad: Reinforcement learning from natural language feedback.
- Optimizing generative ai by backpropagating language model feedback
- From words to rewards: Leveraging natural language for reinforcement learning
- Feedback descent: Open-ended text optimization via pairwise comparison
- Language models can learn from verbal feedback without scalar rewards.
Reactions are currently unavailable
Activity
Metadata
Metadata
Assignees
Labels
No labels