Imgx


2025-2026

做 Imgx 的起点很简单:网页上看到一张喜欢的图,好看是好看,但不知道怎么把它变成 Prompt。要下载、上传到另一个网站,再等结果出来,太绕了。

Imgx 是我独立做的 Chrome 扩展。把鼠标放到网页里的图片上,就能直接分析它,并给出中英双语的绘图描述、可复制的 Prompt 和负面提示词。图片不必离开原来的页面。已上架 Chrome Web Store,可以直接安装体验。

为了更接近原图

Imgx 最核心的事情有两步:先判断眼前这张图属于什么,再用这个类型真正关心的问题去问模型。自动路由不是给结果贴一个标签,而是决定后面该用哪套方法反推。

一开始只有一套通用模板。很快我发现,人像、UI 截图和建筑图根本不该被同样对待:人像需要姿态和光线,界面稿需要组件和信息层级,建筑则更在意材质、空间和视角。现在的路由会从图片比例、页面里的 alt、className 和所在网站等线索里累计证据;信号不够,或彼此冲突时,就不替图片做猜测,改由同一次视觉分析从像素里判断。

IMGX / ROUTE ENGINEV2.1

先收集证据,再决定怎么问。

Evidence, not certainty.
ALTPAGE CONTEXTCLASSRATIO
ACCUMULATE多类证据累计评分不把单个线索当成结论
ENOUGH SIGNAL?score ≥ 5
margin ≥ 2
人像还需要摄影媒介证据
YESDIRECT TEMPLATE直接使用最合适的模板
NO / CONFLICTONE VL ANALYSIS让同一次视觉分析从像素判断
8 PROMPT LENSESWHAT EACH ONE PAYS ATTENTION TO
  1. 01Portrait人物、姿态、光线
  2. 02Interface组件、层级、状态
  3. 03Product材质、陈列、镜头
  4. 04Space建筑、空间、视角
  5. 05Scene风景、天气、氛围
  6. 06Illustration笔触、媒介、轮廓
  7. 07Poster版式、字级、阅读顺序
  8. 08General无法确认时的兜底
路由用于缩小提问范围;不确定时,宁可交回视觉模型,也不武断分类。

路由之后是 8 套模板:通用、人像、风景、建筑、产品、UI、插画和海报排版。它们会把注意力放到不同的地方,也会约束模型不要凭空补相机、品牌或 IP。两件事合在一起,目的只有一个:少给一段泛泛的图像描述,多给一段能拿去继续复刻的 Prompt。

把麻烦留在产品里

真正花时间的部分,反而不是调用模型。网页上的图片可能有防盗链,也可能被透明层盖住;模型有时会漏字段、返回不完整的 JSON。Imgx 会尝试找到真实图片、清理返回格式,并在缺少内容时补上必要的信息。用户看到的应该是下一步,而不是一句「生成失败」。

我也不想把创作者的参考图和 Key 收到自己的服务器上。Imgx 用本地 BYOK:图片直接交给用户自己配置的模型服务,Key、历史和队列都留在浏览器里。配置 Key 是件麻烦事,所以我做了服务商预设和逐步引导,尽量让第一次使用不需要查一堆文档。

还在继续磨

这个项目没有停在第一次上架。最近一轮继续围绕“反推得更准”在改:当一张人物占主画面的海报同时像人像又像平面设计时,不再让本地规则武断地选边,改由同一次图像分析从像素里判断;8 类模板也持续补上各自容易漏掉的复刻线索。

Imgx 已上架 Chrome Web Store,目前支持硅基流动、Gemini、通义等兼容 Vision 的服务。这个项目从产品想法、Prompt、交互到扩展实现,都是我一个人慢慢做出来的。

你可以访问 Imgx 官网,或从 Chrome Web Store 安装体验。

Metadata

Last Updated
Dimensions
Characters