分类题库
人工智能大模型
按题型、年份与知识点筛选,快速定位练习题。
题目列表
共 3 题
A53043
基于强化学习的推理能力优化方法面临的主要挑战是什么?
2025年
单选
A53026
基于强化学习的推理能力优化方法面临的主要挑战是什么
2025年
单选
A53023
一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉…
2025年
单选