支撑「图像 coding agent」的引擎
首页说它会自己干活。这一页,告诉你它怎么做到的。底层是一个 coding agent 式的推理引擎:两层上下文压缩、模型自动降级链、结构化视频线、三层一致性锚 —— 让任何模型,哪怕 Qwen,都能在你本地稳定交付整套视觉。
图片编排能力
智能体把需求拆成多张子图,在同一块分层画布上并行生成、统一构图与色调,再逐张落到可回退的图层工程里 —— 不是一次性出图,而是把整套电商 / 品牌物料编排好交付。
- ·分层画布:每张图都是非破坏性图层工程,蒙版 / 调整 / 局部随时回退
- ·成套一致:一款货 → 主图 / 详情 / 多色变体,主体与风格跨图统一
- ·多模型择优:按子任务在 16 个模型间自动选型,不用记参数
- ·本地直读直写:读项目素材、成片写回硬盘,不强制上云
无限画布
不再是一问一答的聊天流:每张图都是画布上的一个节点,参考图 / 提示词 / 模型 / 产物都装在节点里;把节点连起来,让一张图成为下一张的输入,整条创作链路可视、可回溯、可分支 —— 智能体也能直接在画布上新建节点、连线并批量生成。
- ·节点式创作:每个生成是一个独立节点,输入 / 提示词 / 产物集中可见
- ·连线编排:把上游产物接到下游节点,串出多步生成链路
- ·智能体操盘:智能体自动建节点 / 连线 / 批量生成,你只需审核
- ·无限延展:自由缩放平移的画布,多分支并行探索互不打架
视频生成能力
把编排好的画面直接拉进视频线:每个镜头的首帧、尾帧、参考片、配音都由智能体填好并可视编辑,沿时间线串成一支完整的品牌短片 —— 全程非黑盒,逐镜可改。
- ·图生视频:从成套静帧直接生成镜头,主体与风格延续
- ·逐镜可控:首帧 / 尾帧 / 参考片 / 配音逐个镜头独立设定
- ·时间线编排:多镜头拼接成片,节奏与转场可调
- ·模型调度:Veo / Seedance 等视频模型按镜头需求自动选用
本地操作能力
智能体不是只会出图的聊天框:它能列目录、读文件、grep 定位、改代码、新建目录、删旧脚本、跑构建并做类型检查 —— 全部在你本机完成,破坏性操作前先列清单等你确认,素材与代码不离开本地。
- ·文件系统:列目录 / 读写 / 编辑 / 新建目录 / 删除,直达你的工作区
- ·代码与检索:glob / grep 定位,改完跑 LSP 类型检查兜底
- ·Shell:执行构建、批处理等命令,产物写回本地目录
- ·权限分级:删除 / 改写等破坏性操作先确认,不擅自动手
同样的活,花更少的 token
生成的成本,大头在 token。我们从两处下手把它压下来——每一次调用只带必要的上下文,能复用的绝不重复付费。省下的,直接体现在你的账单和等待时间上。
该带什么,才带什么
你说一句,它补成完整指令——但不会把所有历史、所有参考一股脑塞进去。每次调用只挑当下真正需要的上下文,长对话两层压缩成要点,冗余描述自动收敛。上下文小了,token 自然省,响应也更快。
付过一次的,不再付第二次
提示词前缀、工具结果、参考图与其索引分层缓存:同一段上下文命中缓存就直接复用,不再重复上传、重复计费。连续对话、批量生成、反复微调这些高频场景,省得最狠。
想看底层?都在技术文档里
77 个工具按 13 类划分、权限按风险三级分级,加上循环推理、电商主体一致性、崩溃零损失任务系统等 10 项工程纵深——完整的实现细节都整理在技术文档里。
查看技术文档