测评会员优惠活动进行中 · 开通 VIP,有效期内测评不限次 VIP 优惠中 · 测评不限次 立即查看

A53023. 一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉…

单选题

题目描述

一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉择。如果他们 选择直接偏好优化方案,将意味着他们在流程中可以省去以下哪个关键步骤?

选项(单选)