NE101 Camera AI Vision
一个组件,多种 AI 视觉能力——本篇以 OCR(水表读数、商品标签)完整走查这条可插拔流水线;其他能力换
processingExtensionId即可。
1. 方案概述
NeoMind 的 NE101 摄像头组件(ne101_camera) 不只是画面展示——它内置一条 AI 处理流水线:组件本身不运行 AI,而是通过 processingExtensionId 契约,把每一帧抓拍图像交给用户选择的扩展做推理,再把结果以叠加框和虚拟指标的形式回到画面上。
这条流水线是可插拔的——换不同的扩展,同一组件就能完成不同类型的 AI 视觉任务:
| AI 能力 | 选用扩展 | 典型场景 |
|---|---|---|
| OCR 文字识别 | paddle-ocr-v6 / paddle-ocr-vl | 仪表读数(水表、电表、燃气表)、商品与价签标签、数显仪表、铭牌序列号、文档表单 |
| 目标检测 | yolo-device-inference / image-analyzer-v2 | 人流计数、车辆检测、区域入侵告警 |
| 开放词表定位 | locate-anything-v2 | 用自然语言「找 / 数」任意物体、缺陷定位、零样本计数 |
除结构化流水线外,还可用 AI Agent + 视觉大模型 对画面做开放式场景理解(描述、推理、告警),见第 7 节。
本篇以 OCR 文字识别(接 paddle-ocr-v6)为完整走查,演示这条流水线从安装到出结果的全过程;其余能力的配置流程完全相同,只是第 5.3 步更换 processingExtensionId。走查以水表读数和商品标签两个 OCR 场景为例。
数据流向:
推理结果写入虚拟指标 virtual.<扩展>.*,组件据此在画面上叠加检测框或文字框(并可叠加 ROI 高亮),同时供仪表板和 AI Chat 查询。
2. 物料清单(BOM)
| 物料 | 型号/规格 | 数量 | 用途 | 必需 |
|---|---|---|---|---|
| 智能相机 | NE101 或 NE301 | 1+ | 图像采集 | ✅ |
| NeoMind 平台 | v0.8.0+ | 1 | 边缘 AI 管理 | ✅ |
| paddle-ocr-v6 扩展 | v2.7.8+ | 1 | 本地 OCR 推理引擎 | ✅ |
| ne101_camera 组件 | v2.14.10+ | 1 | 摄像头面板 + AI 处理流水线 | ✅(随组件市场提供) |
| 本地 LLM | Ollama 等 | 1 | AI Chat 后端 | 可选 |
3. 前置准备
3.1 NeoMind 安装与配置
完成 NeoMind 的安装、注册和基本配置,详见 NeoMind 快速入门。
3.2 设备接入
将 NE101 或 NE301 注册到 NeoMind 平台(设备类型 ne101_camera),详见 NeoMind 快速入门 - 设备管理。

4. 安装扩展与组件
4.1 安装 paddle-ocr-v6 扩展
进入 Extensions(扩展) 页面,打开扩展市场,搜索 paddle-ocr-v6 并下载安装;安装完成后确认状态为 Running。


paddle-ocr-v6 提供四档推理模型,可在扩展配置或组件面板切换:
| 档位 | 体积 | 适用 |
|---|---|---|
tiny | ~6MB(内置) | CPU 轻量、离线运行(不含日语) |
small | ~18MB(按需下载) | 有 CoreML 或 CUDA,精度更高 |
medium | ~132MB(按需下载) | CUDA 加 ≥16GB 内存,最高精度 |
auto | — | 默认,按主机能力自动选择 |
4.2 确认 ne101_camera 组件可用
ne101_camera 是仪表板组件市场的官方组件。若组件库中未出现,从组件市场安装即可(详见 扩展管理)。
5. 仪表板 配置:摄像头 + OCR 处理流水线
5.1 添加 NE101 摄像头组件
进入 Dashboard(仪表板),创建仪表板后点击 添加面板,选择 NE101 Camera Panel 组件。首次使用时需下载该组件包。


5.2 配置组件并绑定设备
添加组件后,在配置面板中绑定已接入的 NE101 或 NE301 设备;绑定后面板显示实时画面、在线状态与电量。


5.3 启用 AI 推理并选择扩展
在组件配置的 高级 区开启 AI 推理,并在扩展下拉中选择 paddle-ocr-v6(需先安装该扩展,它才会出现在列表中)。选择后模板自动设为 text_detection,调用扩展的 recognize 命令。本篇以 OCR 为例;目标检测、开放词表定位等能力的扩展、模板与参数见第 6 节。


5.4 设置 ROI 关注区域(可选)
画面里往往只有一块区域是「要读的内容」,例如水表的数字轮、标签的文字区。开启 ROI 可在画面上高亮关注区,并按 processingRoiAction 选择统计策略——count(计数)、filter(仅区域内)、filter_outside(仅区域外),再用 processingRoiOverlap(默认 0.6)控制检测框与 ROI 的重叠判定阈值。ROI 支持多边形,可在配置面板中直接在画面上绘制一个或多个关注区。

5.5 自动生成的数据转换任务
开启 AI 推理后,NeoMind 会自动创建一条 数据抓取 / 转换任务(即 Transform 自动化,命名形如 ne101-{设备ID}-paddle_ocr_v6-text_detection):每当设备上传新帧,就把图像注入 paddle-ocr-v6 的 recognize,返回的 text_blocks 写入虚拟指标。

virtual.paddle_ocr_v6.texts // ["00238", "m³"] 识别出的文字
virtual.paddle_ocr_v6.detections // [{bbox, polygon, label, confidence}, ...]
virtual.paddle_ocr_v6.inference_time_ms // 单帧推理耗时(ms)
该任务的转换规则支持二次修改,可定义更丰富的后处理逻辑,例如把读数字符串解析为数值、过滤噪声文本等。

组件读取这些虚拟指标,按归一化坐标在画面上叠加文字框,并在底部信息条显示提取文字、检测框数量与推理耗时。
6. 应用场景
本节按 AI 能力给出典型场景。设备接入、组件添加、绑定、ROI 配置在所有场景中都相同(见第 3–5 节),区别只在第 5.3 步选择的扩展、模板与参数:
| AI 能力 | 选用扩展 | 模板 | 关键参数 |
|---|---|---|---|
| OCR 文字识别 | paddle-ocr-v6 / paddle-ocr-vl | text_detection | — |
| 目标检测 | yolo-device-inference / image-analyzer-v2 / locate-anything-v2 | object_detection | processingCategories(如 person,car) |
| 开放词表定位 | locate-anything-v2 | grounding | processingPhrase(自然语言描述) |
6.1 OCR 文字识别
水表读数:将相机正对水表,ROI 框在读数区域,processingRoiAction = filter 过滤掉表盘 logo、型号等无关文字。抓拍后画面叠加识别到的数字与单位(如 00238、m³);读数经 数据转换 解析为数值后可做用量趋势。

商品标签:相机对准货架价签或传送带标签,ROI 框住文字主区(品名、SKU、价格、批次),多标签用多 ROI。返回文字可推送 ERP、对账系统,或在仪表板汇总为「本次识别到的 SKU 列表」。
复杂版面(表格、票据、扭曲文档)建议换
paddle-ocr-vl(VLM,需 GPU 服务)。
6.2 目标检测
选 yolo-device-inference(或 image-analyzer-v2),模板自动切换为 object_detection,在 processingCategories 填关注的类别(如 person,car)。抓拍后画面叠加检测框并标注类别,结果写入虚拟指标,可供计数、统计与告警。
- 人流计数 / 车辆检测:
processingCategories = person或car,配合 ROIcount统计区域内目标数量。 - 区域入侵告警:ROI 圈定禁入区,
processingRoiAction = filter,区域内出现目标即触发,结合 自动化规则 推送告警。 - 特定目标检测:stock COCO 80 类之外的目标(工装、安全帽、专属产品等),可替换扩展内的 ONNX 自定义模型。
6.3 开放词表定位
选 locate-anything-v2,模板切换为 grounding,在 processingPhrase 用自然语言描述要找的物体。模型按描述零样本定位,画面叠加定位框并计数,适合固定检测器不认识的类别或临时需求。
- 自然语言计数:
processingPhrase = 穿红马甲的人、货架上的红色商品、地上的垃圾,返回所有匹配位置与数量。 - 缺陷 / 异物定位:描述异常特征(如
划痕、遗留工具)辅助定位,再配合 ROI 或人工复核。
locate-anything-v2还支持text_detection(文字定位)、point(指点定位)等模板,可按需切换。