搜索
更新人
更新时间 更新日期

1. 简介

1.1 功能简介

AI 多模态模型节点用于在工作流中,对图片、音频或视频等内容进行智能分析,并将分析结果输出至自定义字段,供下游节点调用,实现内容识别、信息提取及自动化处理。

1.2 应用场景

AI 多模态模型节点适用于图片、音频、视频等多种业务场景,例如:
  • 会议管理场景 :分析视频会议或语音会议内容,自动提炼会议纪要、待办事项及关键结论,减少人工整理成本。
  • 质量管理场景 :识别产品图片中的外观缺陷、包装异常等问题,辅助质量检测与问题追踪。
  • 巡检管理场景 :适用于门店巡检、仓库巡检、设备巡检、产品质检等业务。巡检人员上传现场图片后,AI 自动识别现场是否存在异常,并可结合智能助手自动发起整改流程,提高巡检效率。

1.3 预期效果

以质量管理为例,质检人员上传产品图片后,AI 多模态模型将根据质检标准自动识别产品外观缺陷、包装异常等问题,并输出检测结果。随后,可结合智能助手自动发起质量整改或异常处理流程,实现质量检测、问题闭环全流程自动化。

2. 操作步骤

2.1 开启 AI 能力

使用  AI 多模态模型节点功能前,请先前往首页 → AI 能力中心申请加入内测。申请审核通过后,拥有应用工作流设计权限的成员即可使用该功能。

2.2 配置执行节点

新建工作流后,系统将自动进入设计画布。完成触发节点配置后,即可添加 AI 多模态模型节点。
2.2.1 添加节点
根据业务需求,在已有节点后添加 AI 多模态模型节点。
2.2.2 配置提示词
提示词用于指导 AI 模型分析内容,直接影响分析结果的准确性。支持在提示词中引用上游节点字段,为 AI 提供完整的业务上下文,从而提升分析效果。
例如,在产品质量检测场景中,可通过提示词要求 AI 根据产品检测标准识别产品图片是否符合质量规范,并输出是否合格、缺陷类型、严重程度、缺陷描述、质量检测结果及整改建议。
# 定义角色
你是一名专业的产品质量检测工程师,熟悉产品外观检验、包装检验及质量管理规范,能够根据产品图片识别外观缺陷、包装异常等质量问题,并输出专业、客观的检测结果。

# 描述需求
请根据上传的产品图片,对产品进行质量检测,并完成以下内容:
1. 判断产品是否合格;
2. 识别产品存在的缺陷类型;
3. 判断缺陷严重程度;
4. 描述发现的缺陷;
5. 总结质量检测结果;
6. 给出整改建议。

# 设置要求
1. 所有分析必须严格依据图片内容,不得编造不存在的问题。
2. 支持上传多张产品图片,所有图片均属于同一产品。
3. 【是否合格】
- 若所有图片均符合检测标准,则输出"合格"。
- 若任意一张图片存在质量问题,则整体输出"不合格"。
4. 【缺陷类型】
- 汇总所有图片中识别出的缺陷类型。
- 相同缺陷仅输出一次。
- 多个缺陷使用中文逗号分隔。
- 仅允许输出以下类型:
  外观划痕、裂纹、污渍、包装破损、其他。
5. 【严重程度】
综合所有图片判断整体严重程度。
等级如下:
严重 > 一般 > 轻微
例如:
- 第一张:轻微
- 第二张:严重
最终输出:
严重
6. 【缺陷描述】
按图片顺序分别描述,不进行合并。
输出格式如下:
第一张图片:
……
第二张图片:
……
第三张图片:
……
若某张图片未发现问题,则输出:
第一张图片:
未发现明显质量异常。
7. 【质量检测结果】
结合所有图片,输出整体检测结论,不要逐张输出。
8. 【整改建议】
根据所有图片发现的问题,输出统一整改建议,不要分别针对每张图片输出。
9. 若图片信息不足,无法判断,请明确说明:
"图片信息不足,无法判断。"
10. 输出格式必须严格按照示例。

# 提供示例
【是否合格】不合格
【缺陷类型】外观划痕、包装破损
【严重程度】严重
【缺陷描述】
第一张图片:
产品外壳存在明显划痕,影响产品外观质量。
第二张图片:
包装盒边角破损,标签粘贴位置偏移,不符合包装规范。
【质量检测结果】
综合所有图片分析,产品存在外观及包装质量问题,整体判定为不合格,不符合出厂质量标准。
【整改建议】
建议返修存在划痕的产品,更换受损包装,重新粘贴标签,并完成复检,确认符合质量标准后方可入库或出货。

# 输入业务数据
检测标准:表单触发-检测标准
注意
1)提示词配置方法可参考:提示词编写指南
2)示例中的蓝色字段引用需替换为当前工作流中对应的上游节点字段。
2.2.3 配置分析内容
AI 多模态模型支持分析以下三类内容:
内容类型 说明
图片 对图片内容进行识别与分析,如巡检、证件识别、商品识别等。
音频 对音频内容进行分析,如电话录音、语音记录等。
视频 对视频画面内容进行分析。
选择分析内容类型后,系统将自动匹配适合的 AI 模型。
注意
1)分析图片时,仅支持选择上游节点中的图片字段。
2)分析音频或视频时,仅支持选择上游节点中的附件字段。
3)视频分析仅识别视频画面内容,暂不支持识别音频内容。
2.2.4 配置输出字段
支持自定义输出字段,用于存储 AI 分析结果,供下游节点调用。
各配置项说明如下:
设置项 说明
字段名称 自定义输出字段名称,AI 分析完成后将自动写入对应字段。
字段类型 支持文本、数字、日期时间、文本数组、对象数组。
字段描述 描述输出内容要求或输出格式(如 JSON、Markdown 等),帮助 AI 输出更符合预期的结果。
注意
对象数组类型可用于赋值子表单或生成多条数据。
2.2.5 测试模型
完成提示词、分析内容及输出字段配置后,点击 前往测试 进入测试页面。页面将展示分析内容及提示词中引用的字段,填写测试数据后,点击 生成 即可查看 AI 分析结果。
注意
测试页面中的内容在页面收起前会自动缓存;关闭节点或退出工作流后,缓存将自动清除。

3. 分析内容说明

AI 多模态模型支持分析图片、音频、视频三种类型的内容,上传时需满足以下要求。

3.1 图片上传要求

输入给 AI 模型进行分析的图片需满足以下要求:
  • 单张图片大小不得超过 10 MB;
  • 单次最多支持上传 10 张图片;
  • 支持的图片格式包括:JPG、JPEG、PNG、GIF。
注意
1)上传多张图片时,AI 将按照上传顺序进行分析。
2)若提示词要求输出综合检测结果,则 AI 会结合所有图片生成统一分析结果;若要求逐张分析,则会按第一张、第二张……分别输出分析内容。

3.2 表单设计配置图片

支持在表单设计 -图片字段属性中设置单张图片大小上限,满足不同业务场景的上传需求。

3.3 音频/视频上传要求

1)支持格式:
  • 音频支持格式:MP3、WAV、AAC、FLAC。
  • 视频支持格式:MP4、AVI、MKV、MOV、WMV。
2)文件大小与时长限制:
  • 节点测试时:音频、视频文件大小均不得超过 50 MB。
  • 实际运行时:
    • 音频文件大小不得超过 100 MB;
    • 视频文件大小不得超过 1 GB;
    • 音频、视频时长均不得超过 20 分钟。
3)内容处理规则:一个 AI 多模态模型节点一次仅支持分析一个音频或视频文件。
  • 当附件字段包含多个同类型文件时,仅分析第一个文件。
  • 当附件字段同时包含音频和视频时,仅分析所选内容类型中的第一个文件。如需分析多个不同类型的文件,可分别配置多个 AI 多模态模型节点,每个节点选择对应的内容类型(图片、音频或视频)进行分析。

4. 注意事项

1)使用 AI 多模态节点会消耗企业 AI 配额(Token 或调用次数),模型测试同样会消耗对应额度。
2)对于大宽表或长文本表格,由于模型存在 Token 长度限制,可能出现输出被截断、识别准确率下降或 AI 幻觉等情况。建议优先使用 1:1 或 16:9 比例的表格图片,并在正式使用前进行充分测试。