大数据

⚠️ 资料来源于互联网整理,仅作备考参考,正式结论请以官方教程与考纲为准。发现错误欢迎反馈问题。

🔒 本篇为会员内容。开通会员 →(全站会员内容畅读 · 附件下载 · 专享答疑)

学科 案例专题(科目二) | 章节 §10 | 考点类型 — | 重要度 — | 知识点ID —

学科:案例专题(科目二) | 大纲域:§10 | 考频:每年 1-3 题 题目与解析来自 raw/kb26-题库练习/(二级来源);每题已绑定知识点 ID,可在对应知识点页对照复习。

1. 关于 HDFS 的体系结构,下列说法错误的是:

题型:单选 | 难度:中 | 知识点:CASE-03 信息系统架构与TOGAF

  • A. NameNode 负责管理文件系统的命名空间和数据块到 DataNode 的映射
  • B. DataNode 负责存储实际的数据块并周期性向 NameNode 上报块信息
  • C. 文件被切分为固定大小的数据块,默认保存 3 个副本
  • D. HDFS 适合存储海量小文件,且对低延迟随机访问有良好支持 ✅

答案:D

解析(采分点):HDFS 为「一次写入、多次读取」的大文件批处理场景设计,海量小文件会撑爆 NameNode 内存,且其面向高吞吐而非低延迟随机访问;低延迟随机读写应选 HBase。


2. HDFS 中真正保存文件元数据(目录树、文件到块、块到 DataNode 的映射)的是:

题型:单选 | 难度:易 | 知识点:CASE-04 大数据Lambda与Kappa架构

  • A. NameNode ✅
  • B. DataNode
  • C. SecondaryNameNode
  • D. JournalNode

答案:A

解析(采分点):NameNode 管元数据,DataNode 存数据块;SecondaryNameNode 只负责定期合并 fsimage 与 editlog,不是热备;JournalNode 用于 HA 模式下共享 editlog。


3. MapReduce 作业的执行流程,正确的顺序是:

题型:单选 | 难度:中 | 知识点:CS-04 冯诺依曼结构与存储程序

  • A. Reduce → Shuffle → Map
  • B. Map → Shuffle → Reduce ✅
  • C. Map → Reduce → Shuffle
  • D. Shuffle → Map → Reduce

答案:B

解析(采分点):Map 阶段对输入分片并行产出键值对;Shuffle 阶段做分区、排序、合并并把同一 key 的数据拉取到对应 Reduce;Reduce 阶段做聚合输出。Shuffle 是 Map 和 Reduce 之间的桥梁。


4. 在 YARN 中,负责整个集群全局资源调度的组件是:

题型:单选 | 难度:易 | 知识点:CASE-01 中间件技术

  • A. ResourceManager ✅
  • B. NodeManager
  • C. ApplicationMaster
  • D. Container

答案:A

解析(采分点):ResourceManager 负责全局资源管理与调度;NodeManager 管理单个节点的资源与容器;ApplicationMaster 负责单个应用的任务协商与监控;Container 是 CPU/内存等资源的封装单位。


5. 关于 Hive 的描述,下列错误的是:

题型:单选 | 难度:难 | 知识点:CASE-11 通信系统网络架构

  • A. Hive 提供类 SQL 的查询语言 HiveQL,本质是「SQL on Hadoop」
  • B. Hive 常被用作离线数据仓库,底层可基于 HDFS 存储
  • C. Hive 的元数据(表结构、分区等)通常存放在 MySQL 等关系库中
  • D. Hive 是面向高并发、毫秒级响应的联机事务处理(OLTP)系统 ✅

答案:D

解析(采分点):Hive 把 HiveQL 翻译为 MapReduce/Tez/Spark 作业执行,适合海量数据的离线批量分析(OLAP 倾向),延迟高、不支持高并发事务,不能当 OLTP 业务库用。

显示剩余 75% 未加载,展开全文会员 / 金牌会员可阅读全文、下载附件、专享答疑了解会员权益