开场白

王姐的新需求:让机器“看见”

全部 · 视觉家族树地图 王姐要装“智慧之眼”,老周带小陈从像素开始学计算机视觉

云间书店的网店、AI 荐书、手游都上线了,一切蒸蒸日上。这天,王姐开完会回来,眼睛又亮了:

"小陈!我这次出差参观了一家智慧书店,人家门口摄像头一照,就知道今天进了多少人、哪个区域最热闹;顾客拿本书拍个照,就能搜到这本书的详情和库存;还有快递单自动录入,都不用人工输!"

"咱们书店也要上!"王姐一挥手,"装摄像头、做识别、全给我配上!一个月够了吧?"

小陈腿一软:"王姐……这、这不是普通开发啊,这是计算机视觉……"

"那更好!"王姐更兴奋了,"听说现在很火!人工智能嘛,咱们云间书店也要搞!老周,你带他搞!"

老周慢悠悠喝了口茶:"王姐,视觉这套东西,可不是往摄像头后面接个程序那么简单——'让机器看见',背后是一整条技术链。不过您说得对,这事值得搞。小陈,走,咱们从'像素'开始,把'让机器看见'这件事,一层一层讲清楚。"


一张给视觉开发小白的地图

老周在白板上画出第九棵家族树:

第十二层:部署与应用 ── 模型部署 · ONNX · TensorRT · 边缘端 · 产品化
第十一层:视频理解 ── 视频处理 · 光流 · 目标跟踪 · 动作识别
第十层:OCR 文字识别 ── 文字检测 · 文字识别 · CRNN · PaddleOCR
第九层:人脸与关键点 ── 人脸检测 · 人脸识别 · 关键点 · 活体检测
第八层:图像分割 ── 语义分割 · 实例分割 · U-Net · Mask R-CNN
第七层:目标检测 ── 候选框 · YOLO · NMS · mAP · 锚框
第六层:图像分类实战 ── CNN训练 · 迁移学习 · 数据增强 · 评估
第五层:深度学习与CNN ── 卷积 · 池化 · 激活函数 · 神经网络
第四层:传统机器学习视觉 ── HOG · SVM · 特征工程 · 分类
第三层:特征提取与匹配 ── 角点 · SIFT · ORB · 图像拼接
第二层:图像处理基础 ── 灰度 · 滤波 · 边缘检测 · 形态学 · 直方图
第一层:图像基础与OpenCV ── 像素 · 色彩空间 · 图像表示 · 图像IO
根:为什么需要计算机视觉?── 让机器"看见"世界

"记住这张图的一句话:计算机视觉的目标,是让机器从图像中'理解'世界——从'看见像素'到'看懂内容'。"

"越往上,越从'处理像素'走向'理解语义':从怎么读图、调图(第一、二层),到找特征、做识别(第三到六层),到检测目标、分割区域(第七、八层),到人脸、文字、视频这些具体场景(第九到十一层),最后是部署上线(第十二层)。"

小陈看着图,深吸一口气:"师傅,这比我之前学的所有东西加起来都大……"

"大,但不乱。"老周说,"咱们按云间书店的真实需求来:客流统计(目标检测)、拍照搜书(图像分类)、快递单识别(OCR)、会员刷脸(人脸识别)——每一个需求,都会带出对应的技术层。做完这四件事,你就把整棵树爬完了。走,从根开始。"


本系列目录

章节 标题 对应视觉概念层 云间书店的故事
第一章 为什么需要计算机视觉 让机器"看见"世界
第二章 图像基础与 OpenCV 第一层 一张照片在电脑里是什么
第三章 图像处理基础 第二层 让模糊的照片变清晰
第四章 特征提取与匹配 第三层 两张图怎么"找相同"
第五章 传统机器学习视觉 第四层 用 SVM 给图书分类
第六章 深度学习与 CNN 第五层 神经网络怎么"看"图
第七章 图像分类实战 第六层 拍照识别书封(拍照搜书)
第八章 目标检测 第七层 摄像头统计客流
第九章 图像分割 第八层 把书架从背景里"抠"出来
第十章 人脸识别与 OCR 第九层 + 第十层 会员刷脸 + 快递单识别
第十一章 视频理解与目标跟踪 第十一层 客流动线分析
终章 部署应用与总结 第十二层 + 全部 云间书店的"智慧之眼"上线

写给读者:这一系列延续云间书店的故事。这一季的主题是计算机视觉开发——目标是给云间书店装上"智慧之眼":客流统计、拍照搜书、OCR 录入、人脸识别。故事里的技术(OpenCV、HOG+SVM、CNN、YOLO、U-Net、PaddleOCR、模型部署)都是真实可用的,代码示例贴近实际开发。跟着小陈一起,从"像素"一路做到"部署",你会发现:让机器看见,没有想象中那么玄,也没有想象中那么简单。 老周在第一章等你。

✌ 语言