测评会员优惠活动进行中 · 开通 VIP,有效期内测评不限次 VIP 优惠中 · 测评不限次 立即查看

PROBLEM SET

强化学习

按知识点筛选题目,系统巩固该考点。

共 11 题
重置

题目列表

共 11 题
A53043 基于强化学习的推理能力优化方法面临的主要挑战是什么? 2025年 强化学习 推理能力优化 -- -- A53026 基于强化学习的推理能力优化方法面临的主要挑战是什么 2025年 强化学习 推理能力优化 挑战分析 -- -- A53023 一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉… 2025年 强化学习 大模型对齐 直接偏好优化 奖励模型 -- -- A69728 强化学习机制中“奖励”信号的关键作用是 2026年 强化学习 奖励信号 智能体决策 -- -- A69710 具身智能系统采用强化学习方法的主要优势是 2026年 强化学习 具身智能 -- -- A69709 下列关于强化学习与监督学习的说法中,正确的是 2026年 强化学习 机器学习 监督学习 -- -- A69672 机器学习的主要类型包括 2026年 强化学习 机器学习 监督学习 无监督学习 -- -- A69310 强化学习机制中“奖励”信号的关键作用是( ) 2026年 强化学习 奖励信号 智能体决策 -- -- A69299 具身智能系统采用强化学习方法的主要优势是( ) 2026年 强化学习 具身智能 -- -- A69298 下列关于强化学习与监督学习的说法中,正确的是( ) 2026年 强化学习 机器学习 监督学习 -- -- A69270 机器学习的主要类型包括( ) 2026年 强化学习 机器学习 监督学习 无监督学习 -- --