多模态架构
MultimodalSkill继承BaseSkill,支持image、audio、video输入。架构:输入解析->模型调用->结果整合。
图像理解
开发图像理解Skill:接收图片输入,调用视觉模型分析,返回描述文本。支持PNG/JPG/WebP格式。
语音处理
开发语音Skill:接收音频输入,调用ASR模型转文字,再进行文本处理。支持WAV/MP3格式。
实战案例
实战:构建图文问答Agent,上传图片+提问->Skill处理->返回答案。
MultimodalSkill继承BaseSkill,支持image、audio、video输入。架构:输入解析->模型调用->结果整合。
开发图像理解Skill:接收图片输入,调用视觉模型分析,返回描述文本。支持PNG/JPG/WebP格式。
开发语音Skill:接收音频输入,调用ASR模型转文字,再进行文本处理。支持WAV/MP3格式。
实战:构建图文问答Agent,上传图片+提问->Skill处理->返回答案。