返回首页
RadarAI··论文与技术

让 Skill“有图可依”:openJiuwen 首发多模态 Skill 范式 Skill-Omni

中文摘要

openJiuwen发布多模态Skill范式Skill-Omni,让Agent能从网页和视频中提取并复用视觉知识,将Skill从纯文本升级为多模态。

English Summary

openJiuwen launched Skill-Omni, a multimodal Skill paradigm enabling Agents to extract and reuse visual knowledge from web and video, upgrading Skills from pure text to multimodal.

原文节选

📌 一句话摘要 openJiuwen 发布 Skill-Omni,业界最早工程化落地的多模态 Skill 范式,使 Agent 能从网页和视频中提取视觉知识并复用,让 Skill 从纯文本升级为「有图可依」。 📝 详细摘要 文章指出当前 Agent Skill 以纯文本为主,在图像编辑、GUI 自动化等视觉任务中存在明显局限,因为「有些任务不是被说清楚的,而是被看明白的」。针对此,openJiuwen 社区发布 Ski...