图像Skill配置
配置skill.yaml:type: multimodal, input_types: [image, text], model: gpt-4-vision。定义Skill为多模态类型,支持图像和文本输入。
实现图像处理
核心代码:class ImageSkill(MultimodalSkill): def execute(self, image_url, question): return self.model.analyze(image=image_url, prompt=question)。使用模型API分析图像内容。
本地模型支持
使用本地模型:加载LLaVA等开源视觉模型。代码:model = LLaVA.load(); result = model.chat(image_path, question)。适合本地部署无网络访问的场景。
测试验证
测试图像Skill:result = skill.execute(image_url='test.jpg', question='图中有什么?')。检查返回结果是否正确描述图像内容。调整prompt优化结果。