让 AI 描述一张图片
把图拖进来。识图模型在你这台机器上写描述,文件不会离开这个标签页。
选一张图
正在启动…
模型写出来的三段
alt 文本
提示词
这一段是拿模型自己那句话改写的:去掉「there is」「which appears to be」这类叙述骨架,剩下的切成逗号短语,最前面那个媒介词也是从描述里认出来的。没有加「8k, highly detailed」这类词——那是我们编的,不是模型看出来的。
这个页面是怎么跑的
- 一个模型,只下一次用的是 Hugging Face 的 SmolVLM-256M-Instruct(Apache-2.0)转成的 ONNX。浏览器会把权重缓存下来,所以第二次打开一两秒就能用;缓存好之后断网也能在这个标签页里接着处理。
- 图片是缩小,不是上传图片在页面里先缩成一格 512 像素——这正是这个模型训练时读图的尺寸,对应 64 个图像词元,然后交给同一个标签页里的 Worker 线程。这里根本没有「上传」这一步,所以也没有什么可关掉的。
- 跑三趟,出三段视觉那半边只算一次,语言那半边接着对同一张图回答三个问题:一段长描述、一句 alt 文本,再加一句种子句,改写成提示词那一行。
| 路径 | 首次下载 | 详细描述 | 三段合计 |
|---|---|---|---|
| WebGPU | 194 MB | 6.0 s | 6.8 s |
| CPU(WebAssembly) | 251 MB | 11.6 s | 14.1 s |
没有 WebGPU 的老笔记本,会比上面 CPU 那一行更慢。手机也能跑,但要先下 251 MB 的 CPU 版本,建议连 Wi-Fi。
这个模型做不到的事
- 它不认识具体的人和牌子。人名、品牌、地标、画家名字它都不知道——2.56 亿参数装不下这些,硬问它就会瞎编一个。
- 它只认得画面里最大的那几个字。海报上的大标题一般能读出来,小票、幻灯片、满屏小字的截图就不行。
- 它只会写英文。训练语料是英文图注,让它输出中文,句子会散掉,所以这版就只出英文。
- 它数不准数。四十个人的画面它可能写成「两个人」,凡是带数字的说法,发布前自己核一遍。
常见问题
我的图片会被上传吗?
不会。这个站上就没有接收图片的接口——页面只从 CDN 取模型权重,之后全部计算在这个标签页的 Worker 线程里完成。你可以打开浏览器的网络面板,描述一张图,看有没有一条请求带着你的图片出去。也正因为算力用的是你自己的设备,这里不需要账号,也没有每天几次的限制。
和 imageprompt.org、Midjourney 的 /describe 比,差别在哪?
差别是那些都要把图发到服务器。2026 年 9 月实测:imageprompt.org 每天送 5 次额度且要注册,describeimage.ai 不用登录但限速,ImageContext 每 10 分钟 5 条、并且自己页面上写明「图片会发给第三方 AI 提供商」,Midjourney 的 /describe 要先订阅。这一页给你的模型小得多,换来的是不上传、不登录、不计次。
为什么描述里不写人名、品牌和地名?
因为它是真不知道。SmolVLM-256M 只有 2.56 亿参数,大概是那些云端模型的千分之一,这点参数用在了形状、材质和画面布局上,没有一份明星和商标的记忆清单。它会写「一个人骑着马」而不是猜一个名字——对 alt 文本来说,这反而是对的写法。
这个 alt 文本能直接通过无障碍检查吗?
把它当初稿改,别当成品用。它能把主体和场景说对,也会控制在 125 字符这个惯例之内,省掉的就是打字的那部分。它不知道的是这张图为什么放在你的页面上——商品图要带型号,图表要带结论。检查工具挑的正是这些,只能你自己补。
能一次跑一整个文件夹吗?
这一页不行,免费档是一次一张。不过这里没有排队一说,队列就是你自己的机器。批量、更大的图和更大的 SmolVLM-500M 是 Pro 要解决的事。几十张的量其实不慢:第一张之后模型已经加载好了,在 M2 Max 上每张 WebGPU 约 7 秒、CPU 路径约 14 秒。
我的机器没有 WebGPU,还能用吗?
能。页面探测到没有就自动切到 WebAssembly 版本,在 CPU 上单线程跑:下载量从 194 MB 变成 251 MB,文本解码器换成在 CPU 上更快的那一档量化。M2 Max 上这样跑三段一共约 14 秒(WebGPU 约 7 秒);老一点的笔记本会更久。状态栏一直写着当前走的是哪条路。
能让它用中文写描述吗?
这一版不能。SmolVLM-256M 的训练语料是英文图注,让它写中文会出半通不通的句子,与其糊弄不如不做。页面本身是中英双语的,模型输出是英文。想要中文,把英文粘到翻译工具里,或者用下面那个 Mac 版——它自带七种语言的翻译。
2.56 亿参数不够用的时候
Mac 版 Image2Prompt 走的是另一条路:用 MLX 在 Apple 芯片上跑 JoyCaption。代价是一次性下约 9 GB 模型、而且得有台 Mac,换来的是长得多的描述,以及五种提示词风格并排对照——详细描述、Stable Diffusion、MidJourney、Booru 标签、短标题,还能翻成七种语言。规矩和这里一样:图片不出本机。七天免费试用,之后一次性买断。