信奥刷题站
其他赛事2026-04

智能创意主题赛模拟卷(六)- 4-6年级组

题量
25 题
客观题
25 题
建议时长
30 分钟
卷面总分
100 分

高阶难度:侧重数据质量评估、模型训练集逻辑以及机器学习中的数据偏差分析。

开始整卷模拟计时作答 · 交卷即时判分 · 错题自动进错题本(需登录)

// questions

题目预览

1
单选题4

在人工智能领域,“数据标注”这项工作最准确的定义和作用是什么?( )

A

为未处理的原始数据添加标签和分类,以便让机器学习并寻找规律

B

通过硬件升级提升数据在计算机内部主板总线上的物理传输速度

C

将复杂的人工智能底层代码转化为普通用户能够直接阅读的语言

D

利用复杂的加密算法对用户的个人隐私数据进行最高级别的封锁

2
单选题4

如果一个AI翻译模型在训练时,吸收了大量存在语法错误的民间网络翻译文章,这会导致?( )

A

模型会自动启动内置的语法纠错系统,把所有的错误都自动修正

B

模型输出的结果也会包含大量的语法错误,这被称为垃圾进垃圾出

C

模型在运行时会因为数据格式不兼容而导致计算机硬件系统崩溃

D

模型会变得非常聪明,甚至能够发明出一种全人类都听不懂的新语言

3
单选题4

科学家在训练AI时,必须将数据划分为“训练集”和“测试集”。“测试集”的主要功能是?( )

A

作为模型日常学习的主要教材,让模型反复阅读并加深数据记忆

B

用来测试计算机显卡的最高温度,防止在长时间运算时发生火灾

C

作为未见过的新题目,用来客观检验模型是否真正掌握了泛化能力

D

用来测试网络连接的稳定性,确保数据在传输过程中不会发生丢包

4
单选题4

龙虾claw小队用1000张“白天在公路上行驶的汽车”照片训练了一个车辆识别AI。到了晚上测试时,AI却什么都认不出来。这是因为?( )

A

计算机的摄像头在夜间会自动关闭感光元件,导致无法输入任何画面

B

该AI算法的代码逻辑在设计时就被设定为只能在白天的时间段内运行

C

测试用的电脑显卡性能太差,无法处理夜间环境下的复杂像素计算

D

训练数据过度单一,缺乏夜间光线环境的样本,导致模型泛化能力差

5
单选题4

“过拟合”是指AI在训练集上得分极高,但在测试集上表现极差。以下哪种比喻最符合这一现象?( )

A

学生死记硬背了所有的模拟试卷答案,但遇到稍微变形的新题就不会做

B

学生在课堂上完全没有听懂老师讲的知识,导致期末考试成绩非常糟糕

C

学生在考试时不小心把选择题的答题卡涂错了位置,导致最终得分为零

D

学生因为考试当天的身体状态不佳,无法发挥出平时掌握的真实水平

6
单选题4

在机器学习中,“多模态(Multimodal)模型”相较于传统单一模型,其最大的技术优势在于?( )

A

它能够在没有电源的情况下依靠内部的备用电池持续运行好几个小时

B

它的算法代码被精简到了极致,只需要占用极少的硬盘存储空间即可

C

它能够同时处理和理解文字、图像、声音等多种不同类型的数据输入

D

它能够自动拦截所有的计算机病毒,确保系统的绝对安全和稳定运行

7
单选题4

如果我们要让一个AI学会下围棋,最适合采用的机器学习方法是?( )

A

无监督学习:让AI随意观察棋盘,不需要设定任何输赢的规则

B

强化学习:让AI在不断自我对弈中,通过胜负反馈来优化策略

C

自然语言处理:让AI阅读大量的围棋小说,理解棋手的心情

D

计算机视觉:只让AI识别出棋盘上有多少个黑色和白色的棋子

8
单选题4

当训练数据中存在明显的“数据不平衡”时(例如:识别猫狗的模型,训练集中99%是猫,1%是狗),最可能发生什么?( )

A

模型会倾向于把所有动物都预测为猫,因为这样能获得最高的表面准确率

B

模型会自动连接互联网,去搜索引擎上下载更多狗的图片来补充训练数据

C

模型会立刻停止训练并在屏幕上弹出错误提示,要求人类重新分配数据

D

模型会因为无法处理极其复杂的比例计算而导致中央处理器发生严重过热

9
单选题4

收集人脸数据用于训练安防AI时,必须遵循的最核心伦理和法律原则是?( )

A

尽可能多地收集人们的私密照片,以确保模型能够识别各种表情

B

必须保证采集到的照片分辨率达到最高标准,否则算法无法运行

C

将收集到的所有数据公开发布到互联网上,供全球的科学家研究

D

遵循知情同意原则,并严格保护数据隐私,防止个人信息被滥用

10
单选题4

在大语言模型(如ChatGPT)的训练过程里,“RLHF(基于人类反馈的强化学习)”这一步骤的目的是?( )

A

为了让AI掌握如何编写复杂的C++计算机底层控制代码

B

通过增加硬盘容量,让AI能够记住互联网上的所有网页

C

让AI的回答更加符合人类的价值观、安全规范以及表达习惯

D

为了让计算机处理器在计算文字概率时能够节省更多电量

11
单选题4

大中信奥的教练在教授C++算法时提到,好的算法可以减少冗余计算。而在AI训练中,如果去除训练数据中的“噪声”,可以达到什么效果?( )

A

让电脑机箱发出的物理噪音变小,从而改善机房内的整体工作环境

B

减少错误和无关数据对模型的干扰,提高模型最终预测的准确度

C

让AI合成语音听起来更加清晰悦耳,消除背景中存在的所有杂音

D

迫使模型学习大量错误的知识,从而使其具备反向思考的批判能力

12
单选题4

“预训练(Pre-training)”是大模型技术中的关键概念,它指的是什么阶段?( )

A

在将计算机硬件出售给用户之前,在工厂里进行的系统通电测试

B

模型在回答用户问题之前,花费几秒钟时间对问题进行语法分析

C

模型在执行特定任务前,先在海量无标注文本上学习语言的普遍规律

D

由人类专家提前写好所有可能出现的提问和标准答案并存入数据库

13
单选题4

如果我们用不同医院的X光片数据共同训练一个医疗AI,但各医院互不共享病人原始数据。这种技术属于?( )

A

联邦学习(Federated Learning),在保护数据隐私的前提下联合训练

B

区块链技术(Blockchain),将所有的病例数据打包并公开记录

C

云计算架构(Cloud Computing),把数据全部集中上传到中心服务器

D

虚拟现实(VR),通过构建虚拟的医院场景来凭空生成所需的病例

14
单选题4

在给图像分类模型进行“数据清洗”时,以下哪项操作是合理且必要的?( )

A

将所有颜色鲜艳的图片亮度调低,以防止对计算机显示器造成伤害

B

把图片中的主要物体全部裁剪掉,只保留背景画面以增加训练难度

C

随机给一半的图片打上完全错误的标签,以考验模型明辨是非的能力

D

剔除其中因拍摄模糊而无法辨认内容的图片,以及标签错误的图片

15
单选题4

为什么很多强大的人工智能模型(如自动驾驶算法)需要不断地进行版本更新和持续迭代?( )

A

因为软件的代码在硬盘中存放时间久了会自动发生腐烂和物理损坏

B

因为真实世界的场景是在不断变化的,模型需要吸收新数据来适应新情况

C

因为开发者需要通过频繁的更新来强制用户重新购买更昂贵的硬件设备

D

因为旧版本的AI在运行三个月后就会自动产生自我意识并拒绝继续工作

16
单选题4

AI算法在处理自然语言时,经常会使用“词向量(Word Embedding)”技术。它的主要作用是?( )

A

把所有的汉字全部翻译成英文单词,因为计算机只能看懂英文字母

B

统计一篇文章中每个词语出现的具体次数,并生成一张复杂的柱状图表

C

将词语转换成包含空间方向的数学向量,从而让计算机能够计算词语间的语义距离

D

自动检测文章中的错别字和语法错误,并在错误的地方画上红色的下划线

17
单选题4

当你使用AI辅助完成一篇学校的科学调研报告时,发现AI提供的某项数据与课本上不一致。你应该?( )

A

保持批判性思维,通过查阅权威文献或官方网站来交叉验证这组数据的真实性

B

无条件相信AI给出的最新数据,并认为学校发放的教科书内容已经完全过时了

C

把AI提供的数据和课本上的数据加起来除以二,取一个平均值写进自己的报告

D

认为AI是一个极其不靠谱的骗子工具,从此以后再也不使用任何人工智能产品

18
单选题4

数据在人工智能的三大核心要素(数据、算力、算法)中扮演着什么角色?( )

A

它是负责执行计算指令的发动机,决定了计算机处理信息的速度快慢

B

它是指导机器如何进行逻辑思考和决策的指令集,类似于烹饪时的菜谱

C

它是用来保护计算机系统免受外部黑客攻击的坚固屏障和防火墙设施

D

它是滋养模型成长的养料和基础素材,其质量直接决定了AI的智能上限

19
单选题4

“监督学习”是指在训练数据中同时包含了题目和答案。以下哪项任务最适合使用监督学习?( )

A

让AI在一堆杂乱无章、没有任何标签的新闻文章中自动找出隐藏的热点话题

B

给AI提供大量带有“良性”或“恶性”医生标注的肿瘤CT照片,让它学习诊断

C

将一个完全不懂规则的机器人放入迷宫中,让它通过不断的碰撞来寻找出口

D

让大模型随机阅读互联网上的所有公开博客,然后自己学会如何写出一首诗

20
单选题4

在给智能语音音箱收集方言训练数据时,如果只收集了年轻人的口音,这可能会导致?( )

A

音箱的扬声器在播放音乐时,只能播放非常动感的流行歌曲

B

音箱的处理器会因为无法处理老年人的声音波段而瞬间烧毁

C

模型在实际应用中,很难准确识别和理解老年人说出的方言指令

D

音箱会自动将所有的老年人用户拉入黑名单并拒绝为他们提供服务

21
单选题4

关于开源数据集(Open Source Datasets),以下说法最准确的是?( )

A

它们是向公众开放共享的数据集合,极大促进了全球AI技术的协同研究与发展

B

它们是充满了恶意计算机病毒的危险文件,任何人都严禁在电脑上下载和使用

C

它们是只有少数顶级科技公司花高价才能购买到的绝密商业情报和算法代码

D

它们是一种能够自动在网络上寻找并窃取其他用户隐私密码的人工智能程序

22
单选题4

在机器学习项目开发周期中,哪个环节通常会耗费工程师最多的时间和精力?( )

A

在电脑上安装最新版本的编程软件并配置好操作系统的环境变量

B

对海量的原始数据进行清洗、筛选、去重以及高质量的人工标注

C

构思AI模型的名字,并为该项目设计一个非常酷炫的3D彩色标志

D

在产品发布会上向公众展示AI模型生成的趣味图片并回答媒体提问

23
单选题4

当我们需要AI对一段长视频的内容进行理解和分类时,算法通常会将视频进行怎样的处理?( )

A

直接通过分析视频文件的后缀名来判断这段视频到底讲述了什么故事

B

将视频的播放速度加快十倍,从而让AI能够在极短的时间内看完剧情

C

把视频完全转换成一段纯文本的字幕文件,彻底丢弃所有的画面信息

D

将连续的视频拆解为一帧帧独立的图像序列,再提取每一帧的视觉特征

24
单选题4

什么是“知识图谱(Knowledge Graph)”?( )

A

一张印有大量数学公式和物理定律的超大型高清彩色纸质海报

B

计算机硬盘内部用来存放各种图片文件的树状目录存储结构

C

一种用网络节点和连线来表示客观世界中实体及其关联关系的结构化数据字典

D

一种能够根据用户的文字描述自动生成优美风景画的人工智能绘图工具

25
单选题4

在评估AI模型时,除了准确率,为什么还需要考察模型的“解释性(Interpretability)”?( )

A

在自动驾驶等高风险领域,人类必须清楚AI做出某个决定的逻辑依据才能放心

B

为了让AI模型能够在发布会上自己念出一段非常流畅且幽默的自我介绍台词

C

如果模型没有解释性,它就会违反计算机保护法并被操作系统强制进行卸载

D

为了确保模型生成的代码可以被翻译成世界上所有的编程语言进行跨平台运行