机器人的觉醒
第二十本《AI 智能体》里,小哲做了「软件智能体」——只会想,不会动。老板看到人形机器人、物流 AGV 的热潮,一拍桌子:「把智能装进身体里!」周师傅说:机器人 = 硬件(身体)+ 感知(五官)+ 决策(大脑)+ 控制(神经)——而 AI 大模型,是机器人「开窍」的最后一块拼图。这一本,从电机讲到人形机器人。
把智能装进身体
机器人全景:硬件 + 感知 + 决策 + 控制 + AI师傅!第二十本我们做了 AI Agent——纯软件的智能体。老板看完人形机器人的演示说:「这才是未来!」我们是不是把账小灵的「大脑」装进一个机器人身体里就行?
哈哈,装进去只是第一步——关键是有「身体」以后的世界完全不同:
- 软件 Agent:世界是「文字/接口」——想清楚就能干。
- 实体机器人:世界是「物理的」——要感知(我在哪)、要规划(怎么走)、要控制(电机听话)、要防撞(别摔)——这叫具身智能。
机器人知识栈五大块:硬件(身体)+ 感知(五官)+ SLAM/导航(认路)+ 控制(神经)+ AI(大脑)。来,十站路线——
记住一句话:软件 Agent 是在「接口的世界」里思考,机器人是在「物理的世界」里活着——先保证不摔,再谈聪明。走,第一站,看机器人的「身体」。
硬件:机械与电子
机械结构 · 电机 · 驱动器 · 主控 · 供电机器人的「身体」是机械 + 电子的结合——关节怎么动、电机怎么转、大脑装在哪。这一站,机器人的「骨架与肌肉」。
机器人硬件五件套:
- 机械结构:底盘(轮式/履带/腿式)、机身、关节、末端执行器(夹爪/吸盘)——机器人的「骨架」。
- 电机(执行器):伺服电机(精准角度,关节用)、步进电机(开环,成本低)、无刷电机(轮子/无人机,效率高)、舵机(小角度)。
- 驱动器:把控制信号变成电机电流——「肌肉的电脉冲」。
- 主控:机器人的「大脑主机」——嵌入式 MCU(简单控制)/ 工控机(SLAM/视觉/AI 重活)/ 树莓派(开发学习)。
- 供电:电池(锂电池)+ 电源管理——电是机器人的「血液」。
┌────────────── 机器人系统 ──────────────┐
│ 感知层(第2站) │
│ LiDAR / 摄像头 / IMU / 超声波 │
│ ↓ 数据 │
│ 决策层(第3-4站 + 第8站) │
│ 主控:工控机(SLAM/规划/AI)+ MCU(控制)│
│ ↓ 指令 │
│ 执行层(第5-6站) │
│ 驱动器 → 电机(伺服/步进/无刷)→ 关节/轮子│
│ ↑ 反馈(编码器:角度/速度) │
│ 电源层:电池 + 电源管理(所有层的血液) │
└──────────────────────────────────────┘
【电机三兄弟(选型)】
伺服电机:闭环精准控制 —— 机械臂关节(贵但准)
步进电机:开环便宜 —— 3D 打印机/低成本设备
无刷电机:高效大力 —— 轮子/无人机(配驱动器)
→ 机器人选电机 = 精度/负载/成本三方权衡
【编码器(反馈的嘴巴)】
装在电机上:报「我转了多少、多快」
→ 控制闭环的基础(第5站 PID 需要它)
【主控分层(大脑分工)】
MCU(嵌入式):实时控制——电机/PID/IO(毫秒级)
工控机(上位机):SLAM/规划/视觉/AI(重计算)
→ 上下位机架构:MCU 管「稳」,工控机管「聪明」
【硬件设计要点】
散热:电机发热大户——要设计散热
防护:防尘防水(IP 等级——室外机器人)
减重:机器人每减 1kg 都是性能(电池/电机压力小)
→ 机器人是「每克都算账」的工程
硬件术语
- 机械结构:底盘/关节/末端——骨架。
- 伺服/步进/无刷电机:精准/便宜/高效——选型权衡。
- 驱动器:信号 → 电流——肌肉的电脉冲。
- 编码器:角度/速度反馈——闭环基础。
- MCU vs 工控机:实时控制 vs 重计算——上下位机。
- 电池/电源管理:血液——电是命脉。
- 减重/散热/防护:硬件设计三要点。
本站收获:硬件 = 机械(骨架)+ 电机驱动(肌肉)+ 主控(大脑)+ 编码器(反馈)+ 电池(血液)。机器人是「每克都算账」的工程——选电机就是精度/负载/成本的权衡。
感知:机器人的五官
LiDAR · 摄像头 · IMU · 点云 · 传感器融合机器人怎么「看」世界?——激光雷达测距、摄像头看图像、IMU 感知姿态。传感器是机器人的五官,感知数据是决策的原料。
感知传感器五兄弟:
- LiDAR(激光雷达):激光测距,扫出周围点云——「眼睛 + 尺子」(精度高,SLAM 主力)。
- 摄像头:2D(图像)/ 深度相机(RGB-D,带距离)——「眼睛」(识别物体用)。
- IMU(惯性测量单元):加速度 + 角速度——「内耳」(感知姿态/运动,GPS 盲区的救星)。
- 超声波 / 红外:近距离测距——「胡须」(防撞补充)。
- 编码器:轮子转了多少——「本体感觉」(里程计,第 1 站)。
关键思想:多传感器融合——单传感器都有弱点,融合互补(LiDAR 看远、IMU 补盲、编码器算里程)——滤波/优化算法把多个源合成可信估计(第六本大数据融合的老朋友)。
【传感器对照】
传感器 感知什么 特点
LiDAR 激光 距离/点云 精准、贵(SLAM 主力)
摄像头/深度 图像/物体 丰富、怕暗(识别用)
IMU 姿态/运动 漂移、但快(补盲用)
超声波/红外 近距离 便宜、糊(防撞)
编码器 轮子里程 漂移、但要算(里程计)
【点云(Point Cloud)】
LiDAR 扫出的「一堆三维点」——世界的 3D 快照
→ SLAM 建图/避障的原料(第3-4站)
→ 点云处理:滤波/分割/配准(大数据思想)
【多传感器融合(灵魂)】
单传感器都有弱点:
LiDAR 怕雨雾 · 相机怕暗 · IMU 会漂移 · 里程计打滑
融合 = 取长补短:
LiDAR 定位 + IMU 短时补盲 + 里程计连续推算
→ 滤波(卡尔曼滤波 KF / 扩展 EKF)或优化(图优化)
→ 「机器人相信谁」是感知的核心问题
【感知 → 决策链路】
传感器 → 数据预处理 → 状态估计(我在哪/周围有啥)
→ 决策(规划)→ 控制(执行)——全书的主线
【传感校准】
传感器装上去要校准(内外参标定)
激光雷达/相机联合标定——「五官要对齐」
感知术语
- LiDAR(激光雷达):测距点云——SLAM 主力。
- 深度相机(RGB-D):图像 + 距离。
- IMU:加速度/角速度——姿态内耳。
- 点云:三维点集合——世界快照。
- 里程计:编码器推算——本体感觉。
- 传感器融合:卡尔曼滤波/优化——取长补短。
- 标定:传感器对齐——五官校准。
本站收获:感知 = LiDAR(距离)+ 相机(图像)+ IMU(姿态)+ 编码器(里程)。单传感器都有弱点——「多传感器融合」让机器人取长补短,是感知的灵魂。
SLAM:定位与建图
SLAM · 激光/视觉 · 栅格地图 · AMCL · 回环检测扫地机器人怎么知道「我在哪、这屋长啥样」?——SLAM(同步定位与建图):一边建地图,一边在地图里找自己——机器人的「认路神技」。
SLAM 两大流派:
- 激光 SLAM:LiDAR 点云建图——精度高、成熟(扫地机器人/AGV 标配)。地图是「栅格地图」(网格:障碍/空地)。
- 视觉 SLAM:摄像头图像建图——成本低、信息丰富(手机 AR、视觉方案)——对算力和光照要求高。
定位(知道我在哪):AMCL(自适应蒙特卡洛定位)——在地图里撒一堆「粒子」,根据传感器观测不断收敛到真实位置——「粒子滤波定位」。
回环检测:走到之前来过的地方 → 识别出来 → 修正累计误差——SLAM 不漂移的关键。
【SLAM 两大任务(互相依赖)】
建图:画地图(栅格地图:障碍/空地)
定位:在地图里找自己(我在哪格)
→ 建图需要知道位置,定位需要地图——鸡生蛋问题
→ SLAM 一起解:边建图边定位(循环优化)
【激光 vs 视觉 SLAM】
激光 SLAM:LiDAR 点云 → 精度高/稳定 —— 扫地机/AGV
视觉 SLAM:摄像头图像 → 便宜/丰富 —— AR/手机
→ 选型:看成本、算力、环境(视觉怕暗)
【AMCL 粒子滤波定位(我在哪)】
地图上撒 1000 个「粒子」(候选位置)
→ 每个粒子按传感器观测打分(越吻合越重)
→ 重采样:淘汰差粒子、繁殖好粒子
→ 收敛到真实位置(像「猜位置游戏」)
→ 这是扫地机器人「充电桩定位」的原理
【回环检测(不漂移的关键)】
机器人转一圈回到原点 → 发现「这里我来过」
→ 把误差拉回去(全局修正)
→ 没有回环 = 走越远漂越偏
【栅格地图(Occupancy Grid)】
地图 = 网格:0(空地)/1(障碍)/未知
→ 导航(第4站)的「世界模型」
→ 文件存成 .pgm/.yaml(ROS 地图格式)
【SLAM 的工程现实】
动态环境:有人走来走去 → 地图会脏(过滤动态物)
对称环境:长走廊没特征 → 定位会漂(靠 IMU 补)
→ SLAM 是「在不确定性里找确定」的学问
第一次进新家:LiDAR 扫描 → 激光 SLAM 建出全屋栅格地图 → AMCL 粒子定位「我在哪」→ 回环检测修正误差 → 规划清扫路径。断电重启?地图存 Flash,重新定位(粒子收敛 3 秒)——「SLAM 让扫地机从瞎转变成有地图的清洁工」。
SLAM 术语
- SLAM:同步定位与建图——鸡生蛋一起解。
- 激光/视觉 SLAM:LiDAR 精度 vs 相机便宜。
- 栅格地图:障碍/空地网格——世界模型。
- AMCL(粒子滤波):撒粒子收敛——我在哪。
- 回环检测:回到原点修正——防漂移。
- 里程计 + IMU:SLAM 的「运动队友」。
- 动态环境:有人走动——地图会脏。
本站收获:SLAM = 建图(画地图)+ 定位(找自己)同步解;激光/视觉两条路;AMCL 粒子滤波定位置、回环检测防漂移——「在不确定性里找确定」是 SLAM 的本质。
规划与导航:怎么走
全局规划 · 局部避障 · DWA · Nav2 · 行为树知道「我在哪 + 要去哪」之后,怎么走?——全局规划找大路(A*),局部规划躲障碍(DWA),两层配合。第二十一本 A* 老朋友在这里升级成「导航」。
导航三层:
- 全局规划:栅格地图上找「大路」——A*/Dijkstra(第六本、第二十一本老朋友)——给出一条全局路径。
- 局部规划(DWA):动态窗口法——实时根据传感器「眼前有没有障碍」调整速度方向——躲避动态障碍物(有人走过来了)。
- 导航框架(Nav2):ROS 的导航套件——全局/局部规划 + 代价地图 + 恢复行为(卡住自动倒车)——「开箱即用的导航大脑」。
决策上层的调度:行为树/状态机——「去充电 → 充满 → 继续扫」的任务编排(第一本/第二十一本状态机老朋友)。
【导航流程】
目标点(充电桩)→ 全局规划(A* 找大路)
→ 沿路走 + 局部规划(DWA 实时避障)
→ 到达?→ 任务完成
【全局规划(A*——第二十一本老朋友)】
栅格地图上搜索:从 A 到 B 的最短路径
代价 = 距离 + 障碍惩罚(走大路不走墙边)
→ 一条「大方向」路径
【局部规划(DWA 动态窗口法)】
实时采样:速度/角速度的「窗口」里试各种组合
打分:离目标近 + 离障碍远 + 速度顺 → 选最优
→ 每 100ms 重新决策——动态环境也能躲
【代价地图(Costmap)】
栅格地图 + 障碍膨胀(把机器人半径算进去)
→ 规划避障的「安全壳」
→ 分全局代价地图/局部代价地图(视野不同)
【Nav2(导航大脑)】
全局/局部规划器 + 代价地图 + 行为树恢复
→ 卡住了自动「倒车→重规划→绕行」
→ ROS 生态的导航标配(第7站 ROS 展开)
【任务编排:行为树/状态机】
状态机:Idle → 扫地 → 低电量 → 回充 → 充满 → 扫地
行为树:条件分支(电量<20%?→ 回充)更灵活
→ 机器人的「工作流引擎」(第二十一本同款思想)
导航术语
- 全局规划:A*/Dijkstra——大方向路径。
- 局部规划(DWA):实时避障——动态窗口采样。
- 代价地图(Costmap):障碍膨胀——安全壳。
- Nav2:ROS 导航套件——规划+恢复行为。
- 行为树/状态机:任务编排——工作流引擎。
- 恢复行为:卡住自动倒车重规划。
- 两层配合:全局找路 + 局部避障。
本站收获:导航 = 全局 A*(找大路)+ 局部 DWA(躲障碍)+ 代价地图(安全壳)+ Nav2(开箱即用)+ 行为树(任务编排)——「大方向看地图,小动作看眼前」。
控制:让电机听话
PID 控制 · 运动学 · 差速/全向底盘 · 轨迹跟踪规划说「直走 2 米」——电机怎么才能真的直走 2 米?PID 控制让实际值追目标值——机器人控制的「万金油」。
控制三件事:
- PID 控制:比例(P:误差大劲大)+ 积分(I:消除稳态误差)+ 微分(D:抑制震荡)——调三个参数让电机又快又稳到达目标。
- 运动学:正运动学(轮速 → 机器人速度)、逆运动学(想要的速度 → 每个轮子转速)——「轮子怎么转」的数学。
- 底盘类型:差速底盘(两轮驱动,转弯靠轮速差——扫地机)、全向底盘(麦克纳姆轮——能横移)、阿克曼(汽车式)。
轨迹跟踪:让机器人沿着规划路径走——横向误差 + 角度误差用 PID 纠正——「走得直不直」看这个。
【PID 控制(机器人的万金油)】
目标速度 1.0 m/s ←→ 实际 0.85 m/s
输出 = Kp×误差 + Ki×∫误差 + Kd×d误差/dt
P:误差越大输出越大(大力出奇迹)
I:长期偏差慢慢补(消除稳态误差)
D:变化太快踩刹车(抑制震荡)
→ 调参:先 P 后 I 再 D——「又快又稳不抖」
【运动学(轮子 ↔ 机器人)】
正运动学:左轮 10、右轮 12 → 机器人怎么动?(算)
逆运动学:想向前 1m/s + 左转 0.5rad/s → 各轮转速?(给)
→ 控制器要的是逆运动学(从目标反推轮速)
【底盘三兄弟】
差速底盘:两轮差速转弯 —— 扫地机/AGV(简单主流)
全向底盘:麦克纳姆轮 —— 能横移(仓库密集场景)
阿克曼:前轮转向 —— 汽车式(室外/搬运)
→ 选底盘 = 场景(室内差速、密集全向、室外阿克曼)
【轨迹跟踪(走得直不直)】
横向误差(偏了 10cm?)+ 角度误差(歪了 3°?)
→ PID 修正轮速 → 回到规划路径
→ 导航(第4站)最后一步的「落地执行」
【控制回路(闭环)】
目标 → PID → 驱动器 → 电机 → 编码器反馈 → 修正
→ 没有反馈的机器人 = 开环 = 会飘(编码器的重要性)
控制术语
- PID:比例+积分+微分——控制万金油。
- 正/逆运动学:轮速→速度 / 速度→轮速。
- 差速/全向/阿克曼底盘:三种行走方式。
- 轨迹跟踪:横向/角度误差修正——走直不直。
- 闭环控制:编码器反馈——不飘的关键。
- 调参:先 P 后 I 再 D——又快又稳不抖。
- 麦克纳姆轮:全向移动——斜轮子。
本站收获:控制 = PID(追目标)+ 运动学(轮速换算)+ 底盘(差速/全向)+ 闭环反馈(编码器)。没有反馈的机器人会飘——「让电机听话」靠的是闭环。
机械臂:机器人的手
正逆运动学 · 轨迹规划 · 抓取 · 力控 · 夹爪轮子让机器人「走」,机械臂让机器人「做」——抓取、装配、分拣。机械臂是工业机器人的主力,也是「手」的技术。
机械臂四件事:
- 自由度与关节:6 自由度机械臂(6 个关节)能到达空间任意位置姿态——「手臂的灵活度」。
- 正逆运动学:正解(关节角 → 末端位置)、逆解(想拿那个点 → 每个关节转多少)——逆解是抓取的数学核心。
- 轨迹规划:末端从 A 到 B 的路径(直线/圆弧)+ 各关节速度规划——「怎么动得稳」。笛卡尔空间 vs 关节空间。
- 抓取与力控:夹爪/吸盘拿物体;力控(感知接触力)——放鸡蛋不能捏碎,装配要「手感」。
【机械臂硬件】
关节:伺服电机 + 减速器(RV/谐波——高精度传动)
末端:夹爪(两指/三指)/ 吸盘(真空)/ 工具(焊枪/螺丝枪)
控制器:专用运动控制器 / 工控机 + 伺服驱动
【正逆运动学(第5站运动学的手臂版)】
正解:知道关节角度 → 末端在哪(好算)
逆解:想末端到某点 → 各关节角度(难算——多解/无解)
→ 抓取流程:视觉定位物体 → 逆解算出关节角 → 动过去
【轨迹规划】
笛卡尔空间:末端走直线(焊接/涂胶要直线)
关节空间:关节平滑转动(快,不管路径形状)
速度规划:梯形/S 曲线(起步加速、到点减速——不抖)
【抓取流程(感知+规划+控制合体)】
① 相机定位物体(第2站/第8站视觉)
② 逆解算抓取姿态
③ 轨迹规划避障
④ 夹爪抓取(力控:夹紧到合适力度)
→ 「看见 → 想到 → 抓到」的完整链路
【力控(机器人的「手感」)】
力传感器:感知末端受力
力控模式:恒力打磨/柔顺装配(插孔不卡)
→ 没有力控的机械臂 = 有眼睛没触觉
【应用】
工业:焊接/喷涂/装配/码垛(产线主力)
服务:奶茶机器人/咖啡臂(餐饮自动化)
→ 机械臂 + AI 视觉 = 现代智能产线的核心
机械臂术语
- 自由度(DOF):关节数——6 自由度全能。
- 正/逆运动学:关节→末端 / 末端→关节。
- 轨迹规划:笛卡尔直线 / 关节平滑——S 曲线。
- 减速器:RV/谐波——高精度传动。
- 夹爪/吸盘:末端执行器——抓取工具。
- 力控:感知接触力——柔顺/恒力。
- 抓取链路:看见→想到→抓到。
本站收获:机械臂 = 自由度关节 + 逆解(想拿哪就转多少)+ 轨迹规划 + 力控手感。「看见→想到→抓到」是完整链路——机械臂 + AI 视觉是现代智能产线的核心。
ROS:机器人操作系统
ROS · 节点/话题/服务 · TF · ROS2 · Gazebo机器人软件怎么组织?——ROS(机器人操作系统)是机器人开发的「事实标准」:模块间用「话题」通信,像软件的「消息总线」。第二十本 Agent 的发布-订阅老朋友在这里是核心。
ROS 四件事:
- 节点(Node):一个个功能模块——驱动节点、SLAM 节点、导航节点(第二十本 Agent 模块化的老朋友)。
- 话题(Topic):发布-订阅消息——传感器数据、指令到处广播(解耦的核心:谁发谁收互不认识)。
- 服务(Service):请求-响应——「给我地图」「执行动作」(同步调用)。
- TF(坐标变换):机器人各部分坐标关系——「激光雷达装在底盘上方 30cm 偏左 10cm」——多传感器数据对齐的基础。
ROS2:新一代——实时性/多机支持/安全性更好(生产级选择);Gazebo 仿真——先在虚拟世界练,再上真机。
【发布-订阅(机器人软件的灵魂)】
传感器节点 ──发布 /scan(LiDAR)──→ 话题
SLAM 节点 ←─订阅 /scan────────── 话题
SLAM 节点 ──发布 /map(地图)────→ 话题
导航节点 ←─订阅 /map──────────── 话题
→ 各节点互不认识,只通过话题通信——解耦!
【话题 vs 服务】
话题(Topic):持续广播——传感器数据流(异步)
服务(Service):请求-响应——一次性调用(同步)
动作(Action):长任务 + 可取消——导航/抓取
【TF 坐标变换(多传感器对齐)】
map(地图)→ odom(里程)→ base_link(机器人)→ laser(雷达)
每个变换:平移 + 旋转(第二十一本矩阵老朋友)
→ 雷达数据「换算到机器人坐标系」才能用
【ROS 生态(开箱即用)】
gmapping/cartographer(SLAM)、Nav2(导航)
MoveIt(机械臂规划)、rviz(可视化)
→ 机器人开发 80% 是「拼 ROS 生态」——别重复造轮子
【ROS2 vs ROS1】
ROS1:教学/老项目(单机、无实时性)
ROS2:生产(实时、多机、安全)——新项目选 ROS2
【Gazebo 仿真】
虚拟世界测试:先仿真再真机(省钱安全)
→ 机器人开发的「测试环境」(第十六本老朋友思想)
【一个机器人项目的 ROS 组成】
底盘驱动 + LiDAR + SLAM + Nav2 + 视觉 + 行为树
→ 每个模块一个节点,话题串起来——「流水线」
ROS 术语
- ROS:机器人操作系统——事实标准。
- 节点(Node):功能模块——独立进程。
- 话题(Topic):发布-订阅消息——解耦核心。
- 服务(Service)/动作:请求-响应 / 长任务。
- TF 坐标变换:传感器对齐——矩阵老朋友。
- ROS2:新一代——实时/多机/生产级。
- Gazebo:仿真环境——先虚拟后真机。
本站收获:ROS = 节点(模块)+ 话题(发布-订阅)+ TF(坐标对齐)+ 生态(SLAM/Nav2 开箱即用)。机器人开发 80% 是拼 ROS 生态——新项目用 ROS2,先 Gazebo 仿真再真机。
AI:具身智能
视觉识别 · 语音交互 · VLA 大模型 · 强化学习机器人的「大脑」——AI 让机器人从「按程序走」变成「看情况应变」。大模型让机器人「听懂人话、看懂世界」——这就是具身智能。
AI 四件事:
- 视觉识别:目标检测(认出物体)/分割(哪是障碍)/深度估计——「看懂世界」(第四本/第二十三本视觉老朋友)。
- 语音交互:ASR(听懂人话)+ TTS(说话)——「能对话的机器人」(第四本语音)。
- VLA(视觉-语言-动作大模型):把大模型和机器人动作打通——「把桌子上的红杯子拿给我」→ 视觉 + 语言 + 动作一次生成——具身智能的最新浪潮(第二十本 Agent 的物理版)。
- 强化学习控制:让机器人在仿真里自己练走路/抓取——「在试错中学」(AlphaGo 的机器人版)。
【视觉识别(感知进阶)】
目标检测:认出「这是杯子/障碍/人」(YOLO 类)
实例分割:像素级认出物体轮廓(抓取定位用)
→ 第2站感知 + 这里识别 = 「看 + 认」
【语音交互(人机对话)】
ASR:语音 → 文字(听懂)
NLU:理解意图("去厨房" → 目标点)
TTS:文字 → 语音(回答/播报)
→ 服务机器人的「前台能力」
【VLA(具身智能新浪潮)】
"把红杯子拿给我"
→ 视觉编码(看到杯子)→ 语言指令 → 动作生成
→ 端到端输出「关节轨迹」——不用写运动学代码!
→ 代表:Google RT-2、Figure 01(人形机器人)
→ 第20本 Agent 的物理版:Agent 用工具,机器人用「身体」
【强化学习(自己练)】
仿真里让机器人试错:走路/抓取
奖励函数:「走稳 +1,摔倒 -10」→ 学会走路
→ 从仿真到真机(Sim2Real——仿真转移)
【大模型 + 机器人架构】
大脑(大模型:理解/规划)+ 小脑(控制:PID/运动学)
→ 分层:语言/任务理解在云端大模型,实时控制在本地
→ 这是当前人形机器人的主流架构
服务机器人大脑升级:语音「带我去会议室」→ ASR 听懂 → 大模型规划(语义地图找会议室)→ 导航(第4站)出发 → 遇到人问「需要帮助吗」→ 视觉认出用户微笑回应。分层架构:理解在云端大模型,实时控制在本机——「听得懂人话、看得懂世界、走得稳当」。
AI 术语
- 目标检测/分割:认出物体——看 + 认。
- ASR/TTS:语音识别/合成——对话能力。
- VLA 大模型:视觉-语言-动作——端到端动作。
- 强化学习:试错学习——仿真练走路。
- Sim2Real:仿真到真机迁移。
- 分层架构:云端大脑 + 本地小脑。
- 具身智能:AI + 物理身体——Agent 的物理版。
本站收获:AI = 视觉认物体 + 语音听人话 + VLA 大模型端到端 + 强化学习自己练。分层架构:云端大脑(理解)+ 本地小脑(控制)——「具身智能 = 第二十本 Agent + 一副身体」。
应用场景:机器人的职业
服务/工业/无人机/人形/物流 · 技术组合机器人已经「上班」了——扫地、送餐、分拣、巡检、跳舞。这一站,看各场景的技术组合——同样的知识栈,不同的侧重。
机器人五大「职业」:
- 服务机器人:扫地(SLAM+导航)、送餐(导航+避障)、导览(语音+视觉)——家庭/商业场景。
- 工业机器人:AGV/AMR(物流搬运——SLAM+导航+调度)、机械臂(焊接/装配——运动学+力控)、分拣(视觉+机械臂)。
- 无人机:航拍/巡检/配送——飞行控制 + 视觉避障(第5站控制的飞行版)。
- 人形机器人:双足行走 + 双臂操作 + 大模型——「终极形态」(还在早期,大厂烧钱中)。
- 特种机器人:巡检(电力/化工)、水下、消防——极端环境作业。
核心规律:万变不离其宗——感知 + SLAM/定位 + 规划 + 控制 + AI,场景只是「组合配方」不同。
【服务机器人(扫地机配方)】
LiDAR + 激光SLAM + AMCL + 栅格地图 + A*/DWA + 电池管理
→ 你家的扫地机器人就是这套(第3-5站全套)
【工业 AGV(物流配方)】
LiDAR + SLAM + 导航 + 多车调度(中央调度系统)
→ 仓库里几百台 AGV 不撞车 = 调度算法
【机械臂分拣(产线配方)】
3D 相机 + 目标检测(第8站)+ 逆运动学 + 轨迹规划 + 力控
→ 「看见 → 抓到 → 放对」——产线主力
【无人机(天空配方)】
飞行控制(姿态/速度——第5站 PID 的飞行版)
+ GPS/视觉定位 + 视觉避障 + 航线规划
→ 第5站控制 + 第4站规划(换个维度)
【人形机器人(终极配方)】
双足平衡(步态控制)+ 双臂 + 视觉语言动作 VLA
+ 云端大模型大脑 + 本地实时小脑
→ 第1-8站全部 + 最新 AI——「机器人领域的皇冠」
【选方向建议】
工业/AGV:需求稳、技术成熟(入行首选)
服务机器人:C 端市场大(扫地/送餐)
人形/具身:前沿热(烧钱但未来)——适合爱冒险的
→ 先做 AGV/服务攒经验,再碰人形
应用术语
- 服务/工业/无人机/人形/特种:五大职业。
- AGV/AMR:物流搬运机器人——多车调度。
- 3D 相机分拣:视觉+臂——产线主力。
- 飞行控制:PID 的飞行版——姿态/航线。
- 人形机器人:双足+双臂+VLA——皇冠。
- 多车调度:几百台 AGV 不撞——算法。
- 配方思维:感知+定位+规划+控制+AI——场景组合。
本站收获:五大职业 = 服务(扫地)/工业(AGV/机械臂)/无人机/人形/特种——「万变不离其宗」:感知+定位+规划+控制+AI 的配方组合。入行建议:先 AGV/服务攒经验,再碰人形。
流程与职业:工程师的路
开发流程 · 岗位 · 学习路线 · 开源社区想进机器人行业?先看开发流程、岗位地图、学习路线——以及「软件工程师转机器人」的现实路径。
机器人开发流程与岗位:
- 开发流程:需求 → 机械设计 → 电子设计 → 嵌入式软件 → 上层算法(SLAM/导航/AI)→ 联调 → 测试 → 量产(第二十四本设备流程的机器人版)。
- 岗位地图:机械工程师(结构)、嵌入式工程师(电机/驱动——软件近亲)、算法工程师(SLAM/导航/AI——高薪)、ROS 开发(系统集成)、测试。
- 学习路线(软件背景):C++/Python → ROS 入门 → 仿真(Gazebo)→ 导航/控制 → 一个完整项目(如做一个能跑的差速小车)。
开源社区是宝库:ROS 生态、开源小车(TurtleBot)、仿真项目——机器人是「站在 ROS 生态上」的行业。
【开发流程(机器人项目)】
需求 → 机械(底盘/外壳)→ 电子(电机/驱动/主控)
→ 嵌入式(底层驱动)→ 算法(SLAM/导航/AI)
→ 联调(软硬齐上)→ 测试(真机跑)→ 量产
→ 和软件不同:每阶段都有「物理的坑」(装不上/跑偏)
【岗位地图(软件背景友好度)】
嵌入式工程师 :驱动/电机控制 —— C 语言 ✅
ROS 开发 :系统集成 —— C++/Python ✅
算法工程师 :SLAM/导航/AI —— 数学+C++(高薪)
机械/电子 :结构/电路 —— 科班
→ 软件转机器人:ROS 开发 + 算法是最近通道
【学习路线(6 个月)】
第1-2月:C++/Python + ROS 基础(节点/话题)
第3月:Gazebo 仿真——虚拟小车动起来
第4月:真机(TurtleBot 类开源小车)——SLAM + 导航
第5月:加视觉/AI(识别)——完整功能
第6月:做项目(送餐机器人/巡检 demo)→ 简历作品
【开源资源】
ROS 官方教程 / ROS2 文档
TurtleBot3(经典开源小车)、F1TENTH(自动驾驶小车)
Gazebo/Webots 仿真、MoveIt(机械臂)
→ 机器人行业「开源氛围浓」——站在巨人肩上
【避坑清单】
✗ 只仿真不上真机(真机和仿真是两回事)
✗ 忽视底层(驱动不稳,算法再好也白搭)
✗ 一上来就搞人形(先做轮式——脚踏实地)
✗ 只看 AI 不看控制(机器人 70% 是「稳」不是「聪明」)
【给新人的话】
机器人 = 软件 × 硬件 × 数学 —— 跨学科的魅力
先做能跑的小车,再谈人形——「机器人工程师的第一步是让它动起来」
职业术语
- 开发流程:机械→电子→软件→算法→联调→量产。
- 嵌入式/ROS/算法:软件背景三通道。
- Gazebo/仿真:先虚拟后真机。
- TurtleBot:开源小车——入门神器。
- Sim2Real:仿真到真机——有落差。
- 轮式先行:先小车再人形——脚踏实地。
- 稳 > 聪明:机器人 70% 是「稳」。
本站收获:流程 = 机械→电子→软件→算法→联调→量产;软件转机器人最近通道 = ROS 开发 + 算法。先做能跑的小车再谈人形——「机器人工程师的第一步是让它动起来」。
知识点速查 + 面试高频题
面试/入行前最后一页机器人开发知识全景表
| 领域 | 核心知识点 | 一句话人话 |
|---|---|---|
| 硬件 | 机械、电机(伺服/步进/无刷)、驱动器、编码器 | 骨架与肌肉 |
| 感知 | LiDAR、相机、IMU、点云、传感器融合 | 五官 |
| SLAM | 激光/视觉 SLAM、栅格地图、AMCL、回环 | 我在哪 + 这有啥 |
| 导航 | A*、DWA、代价地图、Nav2、行为树 | 怎么走 |
| 控制 | PID、运动学、差速/全向底盘、轨迹跟踪 | 让电机听话 |
| 机械臂 | 正逆运动学、轨迹规划、力控、抓取 | 手 |
| ROS | 节点/话题/服务、TF、ROS2、Gazebo | 机器人操作系统 |
| AI | 视觉识别、语音、VLA、强化学习 | 大脑/具身智能 |
| 应用 | 服务/工业/无人机/人形/特种 | 五大职业 |
| 流程职业 | 机械→电子→软件→算法→联调、岗位、路线 | 工程师的路 |
面试高频题速记
- SLAM 是什么?→ 同步定位与建图——边建地图边找自己(鸡生蛋一起解)。
- 激光 SLAM vs 视觉 SLAM?→ LiDAR 精度高成熟 vs 相机便宜丰富——选型看成本环境。
- AMCL 怎么定位?→ 粒子滤波——撒粒子按观测打分收敛。
- 全局规划和局部规划区别?→ A* 找大路 vs DWA 实时避障——两层配合。
- PID 三个参数干嘛的?→ P 误差劲大、I 消稳态误差、D 抑震荡。
- 正逆运动学?→ 关节角→末端(正)/ 末端→关节角(逆——抓取核心)。
- ROS 话题和服务区别?→ 发布-订阅(数据流)vs 请求-响应(一次性)。
- TF 是干嘛的?→ 坐标变换——多传感器数据对齐。
- 为什么传感器要融合?→ 单传感器都有弱点(LiDAR 怕雨、相机怕暗、IMU 漂)——取长补短。
- VLA 是什么?→ 视觉-语言-动作大模型——「把红杯子拿给我」端到端出动作。
机器人是在「物理的世界」里活着——
先保证不摔,再谈聪明。
系统靠 ROS,开窍靠大模型——
机器人的每一步,都是软硬件和数学的合奏;
而具身智能,就是把第二十本的「智能体」,
装进一副能走、能看、能抓的身体里。