使用说明:本文按原文件顺序整理题目,并补充判定依据。原文件提示平台可能随机调整题目和选项,提交时应以题干含义核对,不要只记选项字母。
核对提示:凡原文件缺图、缺选项、缺答案或参考答案存在明显疑点,正文均单独标出,不把无法验证的信息写成确定结论。
一、2026年春江苏开放大学神经网络与深度学习综合大作业单选题
1. 深度学习中,不经常使用的初始化参数W(权重矩阵)的方法是哪种?
- A. MSRA初始化
- B. Xavier初始化
- C. 常量初始化
- D. 高斯分布初始化
原资料参考答案:C
解题思路:所有权重设为同一常量会造成同层神经元对称,得到相同梯度,难以学习不同特征;Xavier、MSRA/He 和适当高斯随机初始化更常见。
2. 深度学习可以用在下列哪些NLP任务中?
- A. 所有选项
- B. 情感分析
- C. 机器翻译
- D. 问答系统
原资料参考答案:A
解题思路:情感分析、机器翻译和问答系统都能用深度学习建模,因此应选择覆盖三项的“所有选项”。
3. 下列哪些项目是在图像识别任务中使用的数据扩增技术(data augmentation technique)?
1水平翻转(Horizontal flipping)
2随机裁剪(Random cropping)
3随机放缩(Random scaling)
4颜色抖动(Color jittering)
5随机平移(Random translation)
6随机剪切(Random shearing)
- A. 2,3,4,5,6
- B. 1,3,5,6
- C. 1,2,4、D
所有项目
原资料参考答案:D
解题思路:水平翻转、随机裁剪、缩放、颜色抖动、平移和剪切均是常见图像增强。原文件的 C、D 选项发生粘连,但资料答案 D 对应“所有项目”。
4. 随着句子的长度越来越多,神经翻译机器将句意表征为固定维度向量的过程将愈加困难,为了解决这类问题,下面哪项是我们可以采用的?
- A. 使用递归单元代替循环单元
- B. 所有选项均不对
- C. 使用注意力机制(attention mechanism)
- D. 使用字符级别翻译(character level translation)
原资料参考答案:C
解题思路:固定维度上下文向量会成为长序列瓶颈;注意力机制允许解码器在每个时间步动态聚合不同编码位置的信息,因此选 C。
5. 你有一个63x63x16的输入,并使用大小为7×7的32个过滤器进行卷积,使用步幅为2和无填充,请问输出是多少?
- A. 29x29x32
- B. 16x16x16
- C. 16x16x32
- D. 29x29x16
原资料参考答案:A
解题思路:无填充卷积的空间尺寸为 floor((63-7)/2)+1=29;每个过滤器生成一个输出通道,32 个过滤器得到 29×29×32。
6. 在CNN中使用1×1卷积时,下列哪一项是正确的?
- A. 它可以帮助降低维数
- B. 可以用于特征池
- C. 由于小的内核大小,它会减少过拟合
- D. 所有上述
原资料参考答案:D
解题思路:原资料标注 D,但该题存在疑点。1×1 卷积可以通过设置输出通道数降维,也可做跨通道特征组合;“因内核小就会减少过拟合”并非必然,所以严格说 A 最稳妥,D 需要以课程口径为准。
7. 有许多种梯度下降算法,其中两种最出名的方法是I-BFGS和SGI-BFGS根据二阶梯度下降而SGD是根据一阶梯度下降的。在下述哪些场景中,会更加偏向于使用I-BFGS而不是SGD?
场景1:数据很稀疏
场景2:神经网络的参数数量较少
- A. 两种情况都是
- B. 场景1
- C. 都不会选择I-BFGS
- D. 场景2
原资料参考答案:A
解题思路:题干中的 I-BFGS、SGI-BFGS 应为 L-BFGS、SGD。L-BFGS 更适合参数较少、可较稳定计算全批梯度的问题;“数据稀疏”本身不足以必然优先 L-BFGS,因此资料答案 A 有疑点,场景2更有确定性。
8. 如果一个神经网络用于预测一种事物的分类,例如分为A,CD四类,那么下列哪一个激活函数适用于该神经网络的输出层
- A. Relu
- B. SigmoiD
- C. TanH
- D. Softmax
原资料参考答案:D
解题思路:四分类互斥输出需要把各类别 logit 归一化为和为 1 的概率分布,Softmax 正适用于这种多分类输出层。
9. 反向传播算法一开始计算什么内容的梯度,之后将其反向传播?
- A. 预测结果与样本标签之间的误差
- B. 都不对
- C. 各个网络权重的平方差之和
- D. 各个输入样本的平方差之和
原资料参考答案:A
解题思路:反向传播从损失函数开始,先计算预测与标签之间误差的梯度,再按链式法则逐层传回各权重与激活。
10. 一个循环神经网络可以被展开成为一个完全连接的、具有无限长度的普通神经网络,这种说法是
- A. 错误的
- B. 正确的
原资料参考答案:B
解题思路:RNN 在时间维度复用同一组参数,可按序列长度展开成等价的前馈计算图;理论上能处理不定长序列,所以资料判“正确”,实际一次计算仍是有限步。
11. 对于MLP,输入层中的节点数为10,隐藏层为5.从输入层到隐藏层的最大连接数是?
- A. 这是一个任意值
- B. 小于50
- C. 50
- D. 超过50
原资料参考答案:C
解题思路:全连接层中每个 10 维输入节点都连接到 5 个隐藏节点,连接权重数为 10×5=50;若另算偏置还会增加 5 个,但题目只问层间连接数。
12. 以下关于深度神经网络的说法中错误的是
- A. 增大L2正则项的系数有助于减缓梯度消失问题
- B. 使用梯度裁剪(gradient clipping)有助于减缓梯度爆炸问题
- C. 若batch size过小,batch normalization的效果会出现退化
- D. 在使用SGD训练时,若训练loss的变化逐渐平缓不再明显下降时,通常可以通过减少learning rate的方式使其再进一步下降
原资料参考答案:A
解题思路:梯度消失主要由深层链式乘积、激活函数饱和和权重尺度引起;增大 L2 系数只是加强权重衰减,并非解决梯度消失的通用手段,所以 A 错误。
13. Sigmoid是神经网络中最常用到的一种激活函数,除非当梯度太大导致激活函数被弥散,这叫作神经元饱和。
这就是为什么ReLU会被提出来,因为ReLU可以使得梯度在正向时输出值与原始值一样。
这就是为什么ReLU会被提出来,因为ReLU可以使得梯度在正向时输出值与原始值一样。
这是否意味着在神经网络中ReLU单元永远不会饱和?
- A. 错误
- B. 正确
原资料参考答案:A
解题思路:ReLU 在正区间不饱和,但负区间梯度为 0,神经元可能长期停留在负区间成为“死亡 ReLU”;因此“永远不会饱和”仍是错误的绝对表述。
14. 给定一个长度为n的不完整单词序列,我们希望预测下一个字母是什么。比如输入是“predictio(9个字母组成),希望预测第十个字母是什么。下面哪种神经网络结构适用于解决这个工作?
- A. 卷积神经网络
- B. 全连接神经网络
- C. 循环神经网络
- D. 受限波尔兹曼机
原资料参考答案:C
解题思路:预测下一个字符依赖前面字符的顺序与上下文,RNN 通过循环状态建模序列依赖,最符合任务结构。
15. 当训练一个神经网络来作图像识别任务时,通常会绘制一张训练集误差和交叉训练集误差图来进行调试。
在上图中,最好在哪个时间停止训练?
- A. B
- B. C
- C. D
- D. A
原资料参考答案:B
解题思路:题目依赖缺失的训练/验证误差曲线。正确原则是在验证误差达到最低点、随后开始回升前停止;原资料标注 B(图中 C 点),但没有图无法核对点位。
16. 下面哪种方法没办法直接应用于自然语言处理的任务?
- A. 去语法模型
- B. 主成分分析(PCA)
- C. 循环神经网络
- D. 卷积神经网络
原资料参考答案:B
解题思路:PCA 是通用线性降维方法,不能直接完成语言建模或序列预测,但可作为特征预处理;RNN、CNN 可直接构建 NLP 模型。题干“直接应用”是判断重点。
17. 图像挖掘中常用卷积神经网络(DNN)作为基础结构,以下关于卷积操作(conv)和池化(pooling)的说法正确的是?
- A. cov基于平移不变性,pooling基于局部相关性
- B. con和pooling都基于平移不变性
- C. conv基于局部相关性,pooling基于平移不变性
- D. convopooling都基于局部相关性
原资料参考答案:A
解题思路:原资料答案 A 与常见理论表述冲突:卷积主要利用局部相关性并通过共享权重获得平移等变性,池化主要增强局部平移不变性,因此严格推导更接近 C。建议按教材原图或原文复核。
18. 下列关于深度学习说法错误的是
- A. 只要参数设置合理,深险学习的效果至少应优于传统机器学习算法
- B. CNN相比于全连接的优势之一是楼型复杂度低,缓解过拟合
- C. LSTM在一定程度上解决了传统RNN梯度满失或梯度爆炸的问题
原资料参考答案:A
解题思路:深度模型没有“参数合理就至少优于传统算法”的保证;小数据、特征结构简单或资源受限时,传统方法可能更好,因此 A 的绝对表述错误。
19. 神经网络,非线性激活函数包括sigmoid/tanh/ReLU等
- A. 总是输出0/1、B、只在最后输出层才会用到
- C. 其他说法都不正确
- D. 加速反向传播时的梯度计算
原资料参考答案:C
解题思路:非线性激活函数可用于隐藏层,输出也不限于 0/1;它们的核心作用是引入非线性表达能力,并非专门加速梯度,所以前三种具体说法均不成立,选 C。
20. 你认为把下面这个过滤器应用到灰度图像会怎么样?
- A. 会检测水平边缘
- B. 会检测垂直边缘
- C. 会检测45度边缘
- D. 会检测图像对比度
原资料参考答案:B
解题思路:原文件没有保留过滤器矩阵,虽然资料标注 B(检测垂直边缘),但无法复算。应查看核矩阵正负权重在左右方向还是上下方向发生变化,再判断响应的边缘方向。
21. 在深度学习网络中,以下哪种技术不是主要用来做网络正则化的(提升模型泛化施力)
- A. Pooling
- B. Early stopping
- C. dropout
- D. 参数共享
原资料参考答案:D
解题思路:资料标注 D,但题目有一定歧义。Early stopping、dropout 明确用于正则化;参数共享通过减少独立参数提升泛化,也常被视为结构性正则;Pooling 主要用于下采样和不变性。应以课程对“主要用途”的定义复核。
22. 你正在训练一个RNN网络,你发现你的权重与激活值都是“NaN”,下列选项中,哪一个是导致这个问题的最有可能的原因?
- A. 梯度消失
- B. Sigmoid函数作为激活函数g(.),在计算g(z)时,z的数值过大了
- C. 梯度爆炸
- D. ReLU函数作为激活函数g(.),在计算g(z)时,z的数值过大了
解题思路:原资料未标注答案。RNN 中梯度爆炸最容易使权重和激活溢出为 Inf,随后在运算中出现 NaN,建议选 C;常用处理是梯度裁剪、降低学习率并检查数值稳定性。

文章评论