第一章

为什么需要计算机视觉

根 · 从像素到语义 机器“看见”和人类看见,完全是两回事

一、机器"看见"和人类看见,完全是两回事

"小陈,你看到这张照片,能说出:这是云间书店的收银台,站着一个店员,后面书架上是书。"老周拿着一张照片说,"但你知道摄像头'看到'的是什么吗?"

"……画面?"

"错。摄像头看到的,只是一堆数字。 比如一个 1920×1080 的照片,就是 1920×1080 个像素,每个像素是三个数字(红、绿、蓝的亮度值)。"

机器眼中的一张图:
  [ [ (245, 23, 12), (250, 20, 10), ... ],
    [ (247, 21, 15), (249, 22, 11), ... ],
    ... 200 万个像素 ...
  ]
  → 在机器眼里,图 = 一个巨大的数字数组
  → "看懂"图 = 从这些数字里找出"语义"
     (这是人、这是书、这是收银台……)

"计算机视觉(Computer Vision)的定义:让计算机从图像/视频中'理解'内容的技术。 人类看一张图,瞬间就知道'这是什么、在哪、在干什么'——但这个能力,让机器做到,难了几十年。"


二、为什么难:一个"一眼就会,但写不出来"的能力

"小陈,如果让你写程序:'判断照片里有没有猫',你会怎么写?"老周问。

小陈想了想:"……判断有没有猫?检查有没有尖耳朵?有没有胡子?呃,猫的颜色有很多种,姿势也千变万化……"

"这就对了。"老周说,"这就是计算机视觉难的地方:'猫'这个概念,没有固定公式。 白猫黑猫、趴着跑着、正面侧面、光线明暗……变化无穷。传统程序写规则,根本写不完。"

为什么"看见"难:
  ① 类内差异大:所有"猫"长得都不一样(姿势/颜色/角度)
  ② 环境变化多:光线、遮挡、模糊、噪声
  ③ 语义无公式:"猫"、"书"这种概念,无法用几条 if 定义
  ④ 尺度问题:近处的大猫、远处的小猫,都是猫

  人类解决这个问题靠:亿万年的进化(大脑视觉皮层)
  机器解决这个问题靠:深度学习(让机器从大量样本里自己学)

  一句话:
    传统编程 = 人告诉机器"规则"(猫有胡子?)
    机器学习 = 人给机器"样本"(这是猫/这不是猫)
    深度学习 = 机器自己从样本中学出"特征"

"计算机视觉的本质,是'从像素到语义'的跨越——跨越的桥梁,早期靠人工设计的特征(第三、四章),现在靠深度神经网络(第六到八章)。"


三、计算机视觉的三大任务:分类、检测、分割

"视觉任务千千万,但核心就三大类。"老周画:

视觉三大核心任务:
  ① 图像分类(Classification):这张图"是什么"?
     [整张图] → "这是猫"
     应用:拍照搜书(整张封面 → 书名)、垃圾图识别

  ② 目标检测(Detection):图里"有什么、在哪"?
     [图] → 框出每个目标 + 类别 + 位置
     "这里有一只猫(框)、那里有一个人(框)"
     应用:客流统计(数人+定位)、货架识别

  ③ 图像分割(Segmentation):每个像素"属于什么"?
     [图] → 每个像素标类别(人/背景/书架)
     应用:把书架从背景"抠"出来、医学影像

  进阶任务:
    人脸识别(是谁)、OCR(是什么字)、
    目标跟踪(它在哪、往哪走)、动作识别(在做什么)、
    图像生成/编辑(AIGC,第十二章顺带讲)

"云间书店的四个需求,正好对应不同任务: 拍照搜书→图像分类;客流统计→目标检测;快递单识别→OCR;会员刷脸→人脸识别。每个任务,后面都有对应的技术栈,咱们一章一章爬。"


四、计算机视觉的"历史路线图"

"咱们这一季的章节顺序,其实就是视觉技术的历史演进。"老周画:

计算机视觉发展史(= 本课程路线):
  1960s-70s:早期图像处理(滤波/边缘)→ 第二章、第三章
  1980s-90s:特征工程(SIFT/角点)→ 第四章
  2000s-10s:机器学习视觉(HOG+SVM)→ 第五章
  2012 起:深度学习爆发(AlexNet)→ 第六、七章
  2015 起:目标检测/分割成熟(YOLO/Mask R-CNN)→ 第八、九章
  2015 起:人脸/OCR 产品化 → 第十章
  近年:视频理解、AIGC 生成 → 第十一章、终章

  重要转折点:
    2012 年 AlexNet 在 ImageNet 大赛碾压式夺冠
    → 深度学习开始统治计算机视觉
    之前:人设计特征(手工特征工程)
    之后:机器自己学特征(端到端学习)

"记住 2012 这个分水岭——之前靠'人想特征',之后靠'机器学特征'。咱们课程也按这个顺序讲:先懂'人想特征'的经典方法(理解原理),再学'机器学特征'的现代方法(实战必备)。"


五、计算机视觉的应用全景

"最后看看视觉在真实世界都在干什么,建立全局观。"老周列出:

计算机视觉应用全景:
  消费领域:人脸解锁、美颜滤镜、拍照识物、AR
  电商零售:拍照搜商品、货架识别、客流统计
  安防监控:人脸识别、行为检测、车牌识别
  自动驾驶:车道线、行人检测、障碍物识别(视觉是核心)
  医疗健康:CT/MRI 影像分析、细胞识别
  工业质检:缺陷检测、尺寸测量
  农业:作物识别、病虫害检测
  内容创作:AIGC(文生图、图生图)、视频编辑

  市场规模:视觉是 AI 最大落地场景之一
  云间书店的应用:客流/搜书/OCR/刷脸(小而美的落地)

"视觉已经无处不在——你手机的人脸解锁、拍题搜答案、扫码识别,全是它在背后工作。云间书店的'智慧之眼',就是一次小而完整的落地实践。"


六、章末:老周的第一章总结

根:为什么需要计算机视觉?
├── 机器"看见"= 读一堆数字(像素数组)
├── 难点:语义无公式("猫"没法用 if 定义)
├── 人类靠进化,机器靠深度学习
├── 三大任务:分类(是什么)/ 检测(在哪)/ 分割(像素属于谁)
├── 演进:特征工程 → 机器学习 → 深度学习(2012 分水岭)
└── 应用:消费/零售/安防/自动驾驶/医疗/工业/AIGC
第二层(预告):图像基础 —— 一张照片在电脑里到底是什么

"小陈,现在你知道'让机器看见'是怎么回事了——本质是'从像素数组里提取语义'。"老周合上白板笔,"下一章,我们正式开始动手:图像基础与 OpenCV。先搞明白'一张照片在电脑里到底是什么',再学会用 OpenCV 读图、改图——这是视觉开发的第一块积木。"

✌ 语言