更新日期
1. 简介
1.1 功能简介
AI 多模态模型节点用于在工作流中,对图片、音频或视频等内容进行智能分析,并将分析结果输出至自定义字段,供下游节点调用,实现内容识别、信息提取及自动化处理。
1.2 应用场景
AI 多模态模型节点适用于图片、音频、视频等多种业务场景,例如:
- 会议管理场景 :分析视频会议或语音会议内容,自动提炼会议纪要、待办事项及关键结论,减少人工整理成本。
- 质量管理场景 :识别产品图片中的外观缺陷、包装异常等问题,辅助质量检测与问题追踪。
- 巡检管理场景 :适用于门店巡检、仓库巡检、设备巡检、产品质检等业务。巡检人员上传现场图片后,AI 自动识别现场是否存在异常,并可结合智能助手自动发起整改流程,提高巡检效率。
1.3 预期效果
以质量管理为例,质检人员上传产品图片后,AI 多模态模型将根据质检标准自动识别产品外观缺陷、包装异常等问题,并输出检测结果。随后,可结合智能助手自动发起质量整改或异常处理流程,实现质量检测、问题闭环全流程自动化。
2. 操作步骤
2.1 开启 AI 能力
使用 AI 多模态模型节点功能前,请先前往首页 → AI 能力中心申请加入内测。申请审核通过后,拥有应用工作流设计权限的成员即可使用该功能。

2.2 配置执行节点
新建工作流后,系统将自动进入设计画布。完成触发节点配置后,即可添加 AI 多模态模型节点。
2.2.1 添加节点
根据业务需求,在已有节点后添加 AI 多模态模型节点。

2.2.2 配置提示词
提示词用于指导 AI 模型分析内容,直接影响分析结果的准确性。支持在提示词中引用上游节点字段,为 AI 提供完整的业务上下文,从而提升分析效果。

例如,在产品质量检测场景中,可通过提示词要求 AI 根据产品检测标准识别产品图片是否符合质量规范,并输出是否合格、缺陷类型、严重程度、缺陷描述、质量检测结果及整改建议。
# 定义角色你是一名专业的产品质量检测工程师,熟悉产品外观检验、包装检验及质量管理规范,能够根据产品图片识别外观缺陷、包装异常等质量问题,并输出专业、客观的检测结果。
# 描述需求请根据上传的产品图片,对产品进行质量检测,并完成以下内容:1. 判断产品是否合格;2. 识别产品存在的缺陷类型;3. 判断缺陷严重程度;4. 描述发现的缺陷;5. 总结质量检测结果;6. 给出整改建议。
# 设置要求1. 所有分析必须严格依据图片内容,不得编造不存在的问题。2. 支持上传多张产品图片,所有图片均属于同一产品。3. 【是否合格】- 若所有图片均符合检测标准,则输出"合格"。- 若任意一张图片存在质量问题,则整体输出"不合格"。4. 【缺陷类型】- 汇总所有图片中识别出的缺陷类型。- 相同缺陷仅输出一次。- 多个缺陷使用中文逗号分隔。- 仅允许输出以下类型:外观划痕、裂纹、污渍、包装破损、其他。5. 【严重程度】综合所有图片判断整体严重程度。等级如下:严重 > 一般 > 轻微例如:- 第一张:轻微- 第二张:严重最终输出:严重6. 【缺陷描述】按图片顺序分别描述,不进行合并。输出格式如下:第一张图片:……第二张图片:……第三张图片:……若某张图片未发现问题,则输出:第一张图片:未发现明显质量异常。7. 【质量检测结果】结合所有图片,输出整体检测结论,不要逐张输出。8. 【整改建议】根据所有图片发现的问题,输出统一整改建议,不要分别针对每张图片输出。9. 若图片信息不足,无法判断,请明确说明:"图片信息不足,无法判断。"10. 输出格式必须严格按照示例。
# 提供示例【是否合格】不合格【缺陷类型】外观划痕、包装破损【严重程度】严重【缺陷描述】第一张图片:产品外壳存在明显划痕,影响产品外观质量。第二张图片:包装盒边角破损,标签粘贴位置偏移,不符合包装规范。【质量检测结果】综合所有图片分析,产品存在外观及包装质量问题,整体判定为不合格,不符合出厂质量标准。【整改建议】建议返修存在划痕的产品,更换受损包装,重新粘贴标签,并完成复检,确认符合质量标准后方可入库或出货。
# 输入业务数据检测标准:表单触发-检测标准
注意 :
1)提示词配置方法可参考:提示词编写指南。
2)示例中的蓝色字段引用需替换为当前工作流中对应的上游节点字段。
2.2.3 配置分析内容
AI 多模态模型支持分析以下三类内容:
| 内容类型 | 说明 |
|---|---|
| 图片 | 对图片内容进行识别与分析,如巡检、证件识别、商品识别等。 |
| 音频 | 对音频内容进行分析,如电话录音、语音记录等。 |
| 视频 | 对视频画面内容进行分析。 |
选择分析内容类型后,系统将自动匹配适合的 AI 模型。

注意 :
1)分析图片时,仅支持选择上游节点中的图片字段。
2)分析音频或视频时,仅支持选择上游节点中的附件字段。
3)视频分析仅识别视频画面内容,暂不支持识别音频内容。
2.2.4 配置输出字段
支持自定义输出字段,用于存储 AI 分析结果,供下游节点调用。
各配置项说明如下:
| 设置项 | 说明 |
|---|---|
| 字段名称 | 自定义输出字段名称,AI 分析完成后将自动写入对应字段。 |
| 字段类型 | 支持文本、数字、日期时间、文本数组、对象数组。 |
| 字段描述 | 描述输出内容要求或输出格式(如 JSON、Markdown 等),帮助 AI 输出更符合预期的结果。 |

注意 :
对象数组类型可用于赋值子表单或生成多条数据。
2.2.5 测试模型
完成提示词、分析内容及输出字段配置后,点击 前往测试 进入测试页面。页面将展示分析内容及提示词中引用的字段,填写测试数据后,点击 生成 即可查看 AI 分析结果。
注意 :
测试页面中的内容在页面收起前会自动缓存;关闭节点或退出工作流后,缓存将自动清除。
3. 分析内容说明
AI 多模态模型支持分析图片、音频、视频三种类型的内容,上传时需满足以下要求。
3.1 图片上传要求
输入给 AI 模型进行分析的图片需满足以下要求:
- 单张图片大小不得超过 10 MB;
- 单次最多支持上传 10 张图片;
- 支持的图片格式包括:JPG、JPEG、PNG、GIF。

注意 :
1)上传多张图片时,AI 将按照上传顺序进行分析。
2)若提示词要求输出综合检测结果,则 AI 会结合所有图片生成统一分析结果;若要求逐张分析,则会按第一张、第二张……分别输出分析内容。
3.2 表单设计配置图片
支持在表单设计 -图片字段属性中设置单张图片大小上限,满足不同业务场景的上传需求。

3.3 音频/视频上传要求
1)支持格式:
- 音频支持格式:MP3、WAV、AAC、FLAC。
- 视频支持格式:MP4、AVI、MKV、MOV、WMV。
2)文件大小与时长限制:
- 节点测试时:音频、视频文件大小均不得超过 50 MB。
- 实际运行时:
- 音频文件大小不得超过 100 MB;
- 视频文件大小不得超过 1 GB;
- 音频、视频时长均不得超过 20 分钟。
3)内容处理规则:一个 AI 多模态模型节点一次仅支持分析一个音频或视频文件。
- 当附件字段包含多个同类型文件时,仅分析第一个文件。
- 当附件字段同时包含音频和视频时,仅分析所选内容类型中的第一个文件。如需分析多个不同类型的文件,可分别配置多个 AI 多模态模型节点,每个节点选择对应的内容类型(图片、音频或视频)进行分析。
4. 注意事项
1)使用 AI 多模态节点会消耗企业 AI 配额(Token 或调用次数),模型测试同样会消耗对应额度。
2)对于大宽表或长文本表格,由于模型存在 Token 长度限制,可能出现输出被截断、识别准确率下降或 AI 幻觉等情况。建议优先使用 1:1 或 16:9 比例的表格图片,并在正式使用前进行充分测试。