PROBLEM SET
低秩分解
按知识点筛选题目,系统巩固该考点。
题目列表
共 2 题
A53060
多头注意⼒(Multi-Head Attention, MHA) 是 Transformer 架构的核⼼组件,在⼤语⾔模型中扮演 着⾄关重要的⻆⾊。MHA 通过并⾏计算多个注意⼒头,能够让模型同时关注序列中不同位置的不同表 ⽰⼦空间,从⽽捕获更丰富的语义信息和位置关系。在标准 MHA 中,每个注意⼒头都维护独⽴的 Key (K) 和 Value (V) 缓存(KV Cache),这在推理阶段会带…
2025年
--
--
A53024
在使用低秩自适应法(Low-Rank Adaptation, LoRA)对一个大语言模型进行微调时,以下哪个操作是其典型的流程?
2025年
--
--