7天上手OpenClaw Day5补充:多模态Skill进阶

多模态架构

MultimodalSkill继承BaseSkill,支持image、audio、video输入。架构:输入解析->模型调用->结果整合。

图像理解

开发图像理解Skill:接收图片输入,调用视觉模型分析,返回描述文本。支持PNG/JPG/WebP格式。

语音处理

开发语音Skill:接收音频输入,调用ASR模型转文字,再进行文本处理。支持WAV/MP3格式。

实战案例

实战:构建图文问答Agent,上传图片+提问->Skill处理->返回答案。

💬 📞