FireRed-Image-Edit 是一个面向复杂指令图像编辑的开源基础模型,重点提升指令遵循、主体一致性、文字编辑、多图参考和画质修复能力。核心设计包括规模化编辑数据引擎、三阶段训练流程,以及面向文字布局的 OCR 奖励机制。
FireRed-OpenStoryline 是一个开源视频剪辑 Agent,能够理解素材、规划故事线、调用剪辑工具,并通过自然语言接受用户修改。它的关键设计包括 Agent Client、Storyline Middleware、MCP Server、资源库和可复用的 Editing Skill。
Agent 获得代码执行和文件读写能力后,必须通过沙箱限制文件系统、网络、进程和资源边界。这里系统讲解 Local Runtime、WASM、Docker、gVisor、MicroVM 的隔离原理、适用场景和工程选型方法。
OpenClaw 的 Skills 可以把大模型从聊天工具扩展成能搜索资料、解析课件、生成知识结构、规划练习、记录进度和润色中文表达的工作流系统。以《世界电影史》课程为例,拆解 6 个 Skills 的职责、调用方式和注意事项。
OpenClaw 可以通过 Skills 调用浏览器、邮件等外部工具,把聊天机器人从“会回复”扩展为“能执行任务”的 AI Agent。这里以默认集成的 agent-browser 和手动安装 email Skill 为例,讲清楚 Skills 的作用、使用方式和配置流程。
多能力 Agent 如果把所有领域知识都塞进 System Prompt,会浪费上下文并降低可扩展性。AgentScope-Java 的 Skill 机制通过元数据、指令、资源三层加载,让 Agent 先知道可用能力,再按任务加载 SOP、参考文档和脚本。
Deep Agents 是构建复杂 AI Agent 的多智能体框架,适合处理长期运行、多步骤规划、文件系统上下文、子代理协作和持久记忆等任务。内容围绕它解决的问题、核心机制、适用场景和上手方式展开。
FunctionGemma 可以把自然语言请求转换为函数调用,但通用模型不一定理解企业内部的工具选择策略。这里用“内部知识库搜索”和“Google 搜索”的路由任务,讲清 FunctionGemma 微调的原因、数据准备方式、训练流程、评估方法,以及 FunctionGemma Tuning Lab 的无代码使用方式。