AI学习中心 / 第17课
零基础课程 · 约25分钟

第17课:Data、Table、Chart

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 理解Data、Dataset、Row、Column、Chart等基础词
  • 掌握数据分析前先检查数据质量的原则
  • 区分相关性与因果性

正文

Data

Data = 数据。

Dataset

Dataset = 数据集。

Row / Column

Row = 行;Column = 列。

Chart

Chart = 图表。

AI做数据分析时最容易犯的错误之一,是直接解释数据,却没有先检查:

  • 缺失值
  • 重复值
  • 单位
  • 日期格式
  • 异常值
  • 样本量
  • 指标定义

一个正确流程

理解问题 → 检查数据 → 清洗 → 分析 → 可视化 → 解释 → 核验。

1. 本课要建立的整体认识

数据分析不是把表格交给AI问“有什么结论”,而是从问题、指标和数据质量出发,经过清洗、探索、建模、解释和核验。

2. 把核心概念逐层拆开

2.1 一行通常代表一个观察对象

一行通常代表一个观察对象,一列代表一个变量;首先要确认分析单位和每列真实含义。

2.2 缺失值、重复值、类型错误、单位不一致、异常值和编码差异会直接改变结果。

缺失值、重复值、类型错误、单位不一致、异常值和编码差异会直接改变结果。

2.3 描述统计回答“数据是什么样”

描述统计回答“数据是什么样”,推断统计尝试从样本讨论总体,两者不能混淆。

2.4 图表应匹配问题:比较用条形图

图表应匹配问题:比较用条形图,趋势用折线图,分布用直方图或箱线图,关系可用散点图。

2.5 相关性不证明因果;要考虑混杂因素、时间顺序、选择偏差和实验或准实验设计。

相关性不证明因果;要考虑混杂因素、时间顺序、选择偏差和实验或准实验设计。

3. 把概念串成一条完整流程

标准流程是:定义问题→形成数据字典→检查质量→记录清洗规则→探索性分析→选择方法→验证假设→制作图表→说明限制→保存可复现过程。

4. 用真实场景理解

满意度上升可能与新功能有关,也可能来自样本变化、活动促销或问卷修改。只展示一张上升折线图不足以证明新功能造成了提升。

5. 学习时应该怎样判断自己是否真正理解

不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。

遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。

6. 本课小结

本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。

7. 进一步拆解:从“知道名词”到“会做判断”

学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:

  • 一行通常代表一个观察对象:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 缺失值、重复值、类型错误、单位不一致、异常值和编码差异会直接改变结果。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 描述统计回答“数据是什么样”:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 图表应匹配问题:比较用条形图:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 相关性不证明因果;要考虑混杂因素、时间顺序、选择偏差和实验或准实验设计。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。

8. 建立自己的操作检查表

第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。

这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。

9. 与前后课程的关系

这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?

10. 课后自查

  1. 我能否不用术语堆砌,用自己的话解释本课核心关系?
  2. 我能否画出一个包含输入、处理、输出和核验的流程?
  3. 我能否举出一个与自己专业、学习或工作有关的实例?
  4. 我能否说出至少两个容易犯的错误,以及怎样提前发现?
  5. 我能否把本课方法用于一个真实任务,并留下可检查的成果?

示例

示例1:问卷数据

分析满意度前先检查重复问卷、缺失值、量表方向和样本来源。

结论:清洗和定义先于分析。

示例2:销量与天气

两者相关不代表天气一定是唯一原因,还可能有节假日、促销等变量。

结论:相关不等于因果。

常见误区

  • “有数据就能得出结论。”——样本和指标可能有偏差。
  • “图表越多分析越专业。”——图表要服务于问题。
  • “相关系数高就证明因果关系。”——相关性不等于因果性。

小测验

点击题目查看答案。

1. EDA 的英文全称是什么?
  1. A. Exploratory Data Analysis
  2. B. External Database Access
  3. C. Extended Digital Algorithm
  4. D. Enterprise Design API
答案:A

EDA = Exploratory Data Analysis,探索性数据分析。

2. 分析数据前,下面哪项最应该先检查?
  1. A. 缺失值、重复值、单位和指标定义
  2. B. 字体颜色
  3. C. 电脑桌面
  4. D. 域名长度
答案:A

数据质量和指标定义直接影响分析结论。

3. “两个变量相关”是否自动意味着因果?
  1. A. 是
  2. B. 不是
  3. C. 只有图表时是
  4. D. 只要AI说是就是
答案:B

相关关系并不能单独证明因果关系。

实践任务

检查一张表

任选一份表格,列出至少8项数据质量检查:缺失、重复、类型、单位、异常值等。

提交物:数据检查清单。

完成标准

  • 至少8项
  • 包含指标定义
  • 包含异常/缺失处理