PROBLEM SET
强化学习
按知识点筛选题目,系统巩固该考点。
题目列表
共 11 题
A53043
基于强化学习的推理能力优化方法面临的主要挑战是什么?
2025年
--
--
A53026
基于强化学习的推理能力优化方法面临的主要挑战是什么
2025年
--
--
A53023
一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉…
2025年
--
--
A69728
强化学习机制中“奖励”信号的关键作用是
2026年
--
--
A69710
具身智能系统采用强化学习方法的主要优势是
2026年
--
--
A69709
下列关于强化学习与监督学习的说法中,正确的是
2026年
--
--
A69672
机器学习的主要类型包括
2026年
--
--
A69310
强化学习机制中“奖励”信号的关键作用是( )
2026年
--
--
A69299
具身智能系统采用强化学习方法的主要优势是( )
2026年
--
--
A69298
下列关于强化学习与监督学习的说法中,正确的是( )
2026年
--
--
A69270
机器学习的主要类型包括( )
2026年
--
--