大数据
⚠️ 资料来源于互联网整理,仅作备考参考,正式结论请以官方教程与考纲为准。发现错误欢迎反馈问题。
🔒 本篇为会员内容。开通会员 →(全站会员内容畅读 · 附件下载 · 专享答疑)
学科 案例专题(科目二) | 章节
§10| 考点类型 — | 重要度 — | 知识点ID—学科:案例专题(科目二) | 大纲域:
§10| 考频:每年 1-3 题 题目与解析来自raw/kb26-题库练习/(二级来源);每题已绑定知识点 ID,可在对应知识点页对照复习。
1. 关于 HDFS 的体系结构,下列说法错误的是:
题型:单选 | 难度:中 | 知识点:
CASE-03信息系统架构与TOGAF
- A. NameNode 负责管理文件系统的命名空间和数据块到 DataNode 的映射
- B. DataNode 负责存储实际的数据块并周期性向 NameNode 上报块信息
- C. 文件被切分为固定大小的数据块,默认保存 3 个副本
- D. HDFS 适合存储海量小文件,且对低延迟随机访问有良好支持 ✅
答案:D
解析(采分点):HDFS 为「一次写入、多次读取」的大文件批处理场景设计,海量小文件会撑爆 NameNode 内存,且其面向高吞吐而非低延迟随机访问;低延迟随机读写应选 HBase。
2. HDFS 中真正保存文件元数据(目录树、文件到块、块到 DataNode 的映射)的是:
题型:单选 | 难度:易 | 知识点:
CASE-04大数据Lambda与Kappa架构
- A. NameNode ✅
- B. DataNode
- C. SecondaryNameNode
- D. JournalNode
答案:A
解析(采分点):NameNode 管元数据,DataNode 存数据块;SecondaryNameNode 只负责定期合并 fsimage 与 editlog,不是热备;JournalNode 用于 HA 模式下共享 editlog。
3. MapReduce 作业的执行流程,正确的顺序是:
题型:单选 | 难度:中 | 知识点:
CS-04冯诺依曼结构与存储程序
- A. Reduce → Shuffle → Map
- B. Map → Shuffle → Reduce ✅
- C. Map → Reduce → Shuffle
- D. Shuffle → Map → Reduce
答案:B
解析(采分点):Map 阶段对输入分片并行产出键值对;Shuffle 阶段做分区、排序、合并并把同一 key 的数据拉取到对应 Reduce;Reduce 阶段做聚合输出。Shuffle 是 Map 和 Reduce 之间的桥梁。
4. 在 YARN 中,负责整个集群全局资源调度的组件是:
题型:单选 | 难度:易 | 知识点:
CASE-01中间件技术
- A. ResourceManager ✅
- B. NodeManager
- C. ApplicationMaster
- D. Container
答案:A
解析(采分点):ResourceManager 负责全局资源管理与调度;NodeManager 管理单个节点的资源与容器;ApplicationMaster 负责单个应用的任务协商与监控;Container 是 CPU/内存等资源的封装单位。
5. 关于 Hive 的描述,下列错误的是:
题型:单选 | 难度:难 | 知识点:
CASE-11通信系统网络架构
- A. Hive 提供类 SQL 的查询语言 HiveQL,本质是「SQL on Hadoop」
- B. Hive 常被用作离线数据仓库,底层可基于 HDFS 存储
- C. Hive 的元数据(表结构、分区等)通常存放在 MySQL 等关系库中
- D. Hive 是面向高并发、毫秒级响应的联机事务处理(OLTP)系统 ✅
答案:D
解析(采分点):Hive 把 HiveQL 翻译为 MapReduce/Tez/Spark 作业执行,适合海量数据的离线批量分析(OLAP 倾向),延迟高、不支持高并发事务,不能当 OLTP 业务库用。