使用说明:本文按原文件顺序整理题目,并补充判定依据。原文件提示平台可能随机调整题目和选项,提交时应以题干含义核对,不要只记选项字母。
核对提示:凡原文件缺图、缺选项、缺答案或参考答案存在明显疑点,正文均单独标出,不把无法验证的信息写成确定结论。
一、2026年春江苏开放大学神经网络与深度学习作业三单选题
1. 强化学习⼤体上可以分为基于值函数的⽅法和基于策略函数的⽅法,则下列说法中错误的是()
- A. Actor-Critic算法融合了基于值函数和策略函数两种⽅法,收敛性更好
- B. 基于策略函数的⽅法在策略更新时会更加平稳
- C. 基于值函数的⽅法策略更新时可能会导致值函数的改变⽐较⼤,影响收敛性
- D. 基于值函数的⽅法容易收敛到局部最优解
原资料参考答案:D
解题思路:资料答案为 D。策略梯度直接优化非凸目标,收敛到局部最优反而是策略方法常见问题;值函数方法更典型的问题是由贪心动作切换引起策略更新不平滑。
2. PyTorch中的基本数据结构为?
- A. tensor
- B. torch
- C. ndarray
- D. dataframE
原资料参考答案:A
解题思路:PyTorch 的核心数据容器是 tensor,它支持多维数组、自动求导和 CPU/GPU 运算;torch 是包名,ndarray 属于 NumPy,DataFrame 常见于 pandas。
3. 下图是⼀个简单的⻢尔可夫过程,以下选项中对该过程描述错误的是()
- A. 与刚下⾬时相⽐,下⾬⼀⼩时后天⽓放晴的概率更⼤
- B. ⽆论是晴天还是⾬天,保持当前状态的概率都⽐相互转化的概率要⼤
- C. 下⾬的概率⽐天⽓晴朗的概率⼤
- D. 下⾬天去散步的概率和晴天打扫房屋的概率⼀样⼤
原资料参考答案:A
解题思路:原题依赖未随文本提供的马尔可夫过程图。原资料标注 A,但缺少状态转移概率和行为标注,无法核验 A 是否确为错误项,导入后应补图再判断。
4. 下列端到端的⽹络结构中,表示Decoder过程的是?
- A. 都不是
- B. B
- C. A
- D. C
原资料参考答案:D
解题思路:题目只保留 A/B/C 图号,实际网络结构图缺失。原资料标注 D(即图 C),但无法从纯文本辨认 Decoder,需补回图片后根据“由潜变量逐步生成输出”的方向判断。
5. 下列关于⻢尔可夫决策过程的叙述,错误的是()
- A. ⻢尔可夫决策过程的⽬标是得到回报的期望最⼤
- B. ⻢尔可夫决策过程的主要元素包括所有状态的集合,所有动作的集合,转移概率算⼦以及奖励函数
- C. 许多强化学习问题都可以转化为⻢尓可夫决策过程来描述
- D. ⻢尔可夫决策过程综合了过去所有的动作来决定下⼀时刻的动作
原资料参考答案:D
解题思路:马尔可夫性质要求在给定当前状态后,未来与更早历史条件独立;决策依据当前状态和策略,不是综合过去所有动作再决定下一动作,所以 D 错误。
6. 在Q-Learning中,所谓的Q函数是指()
- A. 奖励函数
- B. 状态-动作值函数
- C. 策略函数
- D. 状态值函数
原资料参考答案:B
解题思路:Q 函数 q(s,a) 衡量在状态 s 采取动作 a 后的期望累计回报,名称就是状态—动作值函数;状态值函数只以 s 为自变量。
7. 下列关于W-GAN的论述,错误的是()
- A. W-GAN模型使⽤Wasserstein距离替代JS距离
- B. W-GAN保证了⽣成样本的多样性
- C. W-GAN可以避免传统GAN中存在的梯度消失问题
- D. W-GAN中可以直接求解Wasserstein距离
原资料参考答案:D
解题思路:WGAN 用 Wasserstein-1 距离改善梯度,但实际通过满足 Lipschitz 约束的 critic 对其对偶形式作近似优化,并非直接计算原始最优传输距离,因此 D 错误。
8. ⽣成对抗⽹络(GAN)是⼀个具有开创意义的深度⽣成模型,关于GAN下列说法错误的是()
- A. 在GAN的训练过程中,需要平衡判别器与⽣成器两者的能⼒
- B. 判别器的⽬的是判断⼀个样本是⽣成器产⽣的还是真实样本
- C. GAN的训练过程稳定
- D. GAN中⽣成器与判别器的训练⽬标正好相反
原资料参考答案:C
解题思路:标准 GAN 的生成器和判别器进行极小极大博弈,常出现训练震荡、梯度消失和模式坍塌,因此“训练过程稳定”不成立。
9. 下图有两个翻译模型A和B,其中⽤到attention机制的模型是?
- A. A和B都是
- B. A
- C. A和B都不是
- D. B
原资料参考答案:D
解题思路:原题所需的两个翻译模型图未包含在文本中。资料标注 D(模型 B),但应补图后检查解码每一步是否对全部编码状态计算权重并形成上下文向量。
10. RNN在⾃然语⾔处理领域中被⼴泛应⽤,下⾯⼀句话中:我的⼿机坏了,我打算_______⼀部新⼿机。如果想要预测横线中⽂字的内容,最合适使⽤下列哪个模型()
- A. 双向循环神经⽹络
- B. 基本循环神经⽹络
- C. GRU
- D. LSTM
原资料参考答案:A
解题思路:横线左右文字都已知,双向 RNN 能同时利用左侧“打算”和右侧“一部新手机”的上下文,比只能使用单方向历史的模型更匹配该填空任务。
11. 有如下LSTM结构图,下列选项中哪⼀项是计算遗忘⻔?
原资料参考答案:A
解题思路:原文件仅写“正确:A”,没有保留 LSTM 结构图和选项。判别遗忘门应找 f_t=σ(W_f[h_{t-1},x_t]+b_f) 以及它与上一时刻细胞状态 C_{t-1} 的逐元素乘法路径,现有材料不足以核对字母。
12. 下列关于状态值函数vπ(s)和动作值函数qπ(s,a)的叙述,说法正确的是()
- A. 给定初始状态s时,状态值函数可以使⽤动作值函数表示,即vπ(s)=Ea(qπ(s,a))
- B. 状态值函数vπ(s)表示从状态s出发,执⾏动作a后再使⽤策略π带来的回报期望
- C. 动作值函数qπ(s,a)表示从状态s出发,使⽤策略π带来的回报期望
- D. 最优值函数v∗(s)与最优状态值函数q∗(s,a)的值相同
解题思路:原资料未标注答案。固定策略 π 下,状态值等于按策略动作分布对动作值求期望,即 vπ(s)=E_{a~π(·|s)}[qπ(s,a)],因此建议选 A;B、C把两种值函数的条件写反。

文章评论