让 AI 描述一张图片

把图拖进来。识图模型在你这台机器上写描述,文件不会离开这个标签页。

选一张图

也可以先试试这两张:

正在启动…

这个页面是怎么跑的

  1. 一个模型,只下一次用的是 Hugging Face 的 SmolVLM-256M-Instruct(Apache-2.0)转成的 ONNX。浏览器会把权重缓存下来,所以第二次打开一两秒就能用;缓存好之后断网也能在这个标签页里接着处理。
  2. 图片是缩小,不是上传图片在页面里先缩成一格 512 像素——这正是这个模型训练时读图的尺寸,对应 64 个图像词元,然后交给同一个标签页里的 Worker 线程。这里根本没有「上传」这一步,所以也没有什么可关掉的。
  3. 跑三趟,出三段视觉那半边只算一次,语言那半边接着对同一张图回答三个问题:一段长描述、一句 alt 文本,再加一句种子句,改写成提示词那一行。
实测环境:Apple M2 Max,无头 Chromium,2026-09-25,页面按线上的方式提供,所以 CPU 那一行是单线程 WebAssembly;数字取页面自带夜市照片多次运行的中位数。
路径 首次下载 详细描述 三段合计
WebGPU 194 MB6.0 s6.8 s
CPU(WebAssembly) 251 MB11.6 s14.1 s

没有 WebGPU 的老笔记本,会比上面 CPU 那一行更慢。手机也能跑,但要先下 251 MB 的 CPU 版本,建议连 Wi-Fi。

这个模型做不到的事

常见问题

我的图片会被上传吗?

不会。这个站上就没有接收图片的接口——页面只从 CDN 取模型权重,之后全部计算在这个标签页的 Worker 线程里完成。你可以打开浏览器的网络面板,描述一张图,看有没有一条请求带着你的图片出去。也正因为算力用的是你自己的设备,这里不需要账号,也没有每天几次的限制。

和 imageprompt.org、Midjourney 的 /describe 比,差别在哪?

差别是那些都要把图发到服务器。2026 年 9 月实测:imageprompt.org 每天送 5 次额度且要注册,describeimage.ai 不用登录但限速,ImageContext 每 10 分钟 5 条、并且自己页面上写明「图片会发给第三方 AI 提供商」,Midjourney 的 /describe 要先订阅。这一页给你的模型小得多,换来的是不上传、不登录、不计次。

为什么描述里不写人名、品牌和地名?

因为它是真不知道。SmolVLM-256M 只有 2.56 亿参数,大概是那些云端模型的千分之一,这点参数用在了形状、材质和画面布局上,没有一份明星和商标的记忆清单。它会写「一个人骑着马」而不是猜一个名字——对 alt 文本来说,这反而是对的写法。

这个 alt 文本能直接通过无障碍检查吗?

把它当初稿改,别当成品用。它能把主体和场景说对,也会控制在 125 字符这个惯例之内,省掉的就是打字的那部分。它不知道的是这张图为什么放在你的页面上——商品图要带型号,图表要带结论。检查工具挑的正是这些,只能你自己补。

能一次跑一整个文件夹吗?

这一页不行,免费档是一次一张。不过这里没有排队一说,队列就是你自己的机器。批量、更大的图和更大的 SmolVLM-500M 是 Pro 要解决的事。几十张的量其实不慢:第一张之后模型已经加载好了,在 M2 Max 上每张 WebGPU 约 7 秒、CPU 路径约 14 秒。

我的机器没有 WebGPU,还能用吗?

能。页面探测到没有就自动切到 WebAssembly 版本,在 CPU 上单线程跑:下载量从 194 MB 变成 251 MB,文本解码器换成在 CPU 上更快的那一档量化。M2 Max 上这样跑三段一共约 14 秒(WebGPU 约 7 秒);老一点的笔记本会更久。状态栏一直写着当前走的是哪条路。

能让它用中文写描述吗?

这一版不能。SmolVLM-256M 的训练语料是英文图注,让它写中文会出半通不通的句子,与其糊弄不如不做。页面本身是中英双语的,模型输出是英文。想要中文,把英文粘到翻译工具里,或者用下面那个 Mac 版——它自带七种语言的翻译。