朝露も乾かぬうちに、花はもう道をゆく。
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback - CloudYume