跳到正文
Chengshu
@skadai · 2026.09.30
文章
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
多模态
多模态
1 篇文章
2026年9月25日
模型也会看图:ViT、aligner、图像 token 与 Encoder parallel
一张图片如何从像素变成向量、再插进文本序列:32 层 ViT、patch 14、3× 下采样 aligner、每图 1024 token 上限。顺带讲清两个互斥的部署开关(--language-model-only 与 Encoder parallel),以及为什么验证服务时必须发一条图片请求。
DeepSeek
vLLM
模型部署
多模态
术语科普
→