正在加载研知星途数据
连接数据库并同步首页、论文与资源列表
研知星途 logo
研知星途
yzatlas.cn

登录研知星途

登录后可同步书签与邮箱验证状态。

还没有账号?

邮箱注册

请使用邮箱创建账号;密码至少 8 位。

已有账号?
情报简报 ·

研知星途 ·
AI 科研辅导与科研情报平台

研知星途(yzatlas.cn)面向高校学生、研究人员与企业研发团队,提供论文选题辅导、方法实现指导、实验设计与写作支持等个性化科研辅导方案,并实时聚合顶会论文、开源项目、模型数据集与会议征稿信息,助力研究者高效追踪前沿。

论文趋势 · Top 5 方向

每日 06:30 更新
W-3 W-2 W-1 本周 W-7 W-6 W-5 W-4 W-3 W-2 W-1 本周 W-11 W-9 W-7 W-5 W-3 W-1 本周
飙升 Top 3

点击折线 / 图例 / 飙升 chip 跳转论文库并自动筛选该方向

核心论文串讲

开源项目

热门开源模型

热门数据集

顶会截稿雷达

2026-05-24
NeurIPS 2026
主会议投稿截止
2026-06-05
ACM MM 2026
CFP Deadline

竞赛追踪节点

2026-05-17
NTIRE 2026 Challenge
Track 2 提交截止
2026-05-30
AI City Challenge
报名与组队截止

MLLM 学习路线

4 阶段 · 预估学习周期 8–12 周 · 每阶段 9 个内容区块

Stage

本 Stage 共包含 9 个内容区块,建议按顺序阅读;最后通过 FAQ 自检学习效果。

1. 背景介绍 · 学完后能做什么

多模态对齐是把视觉特征"塞进"语言模型的艺术。LLaVA 用最简单的线性投影就做到了令人惊讶的效果;Qwen-VL / InternVL 则在此基础上做了 resampler、动态分辨率等工程优化。

✅ 学完后你能做到:
  • 独立跑通 LLaVA-1.5 inference,理解每行代码做什么
  • 在 100 张自定义图上用 LoRA 微调,得到能"看懂"的模型
  • 解释 Q-Former、Linear Projection、Cross-Attention 三种对齐方式的取舍

2. 前置依赖

必备
PyTorch · Transformers 库 · CUDA 基础
推荐
完成 Stage 1 (Transformer)、Stage 2 (Vision Encoder)
硬件
单卡 24GB+ (A6000/4090) 可跑 7B 推理
数学
线代 · 概率论 · 注意力机制

3. 必读论文 · 阅读顺序

5. 开源代码精选

6. 动手练习 · 三阶难度

入门 · 1 小时
跑通 LLaVA-1.5 inference
官方 demo + 自己 5 张图 · 验证理解
进阶 · 半天
用 LoRA 在 100 张自定义图上微调
使用 LoRA 在 100 张图 + 简单 instruction 上微调,验证 loss 曲线
挑战 · 1 周
引入新的 task-specific 数据集做 benchmark
复现一个 SoTA 数字 ± 2 个百分点

7. 检查点问题(展开看答案)

为什么 LLaVA 用线性投影就够?

CLIP 的视觉特征已经在大规模图文对上对齐到了语言空间;线性投影只需做最后一步"维度对齐"即可,不需要复杂的 cross-attn。这也是 LLaVA 用极小训练量出效果的核心原因。

Resampler(Q-Former)解决什么问题?

压缩视觉 token 数量,从 ViT 输出的 576 个降到 32-64 个,降低 LLM 上下文压力;同时学习 task-aware 表征。代价:训练复杂度上升,需 instruction tuning 数据更精细。

高分辨率处理有哪些方案?

三类:(1) 动态分辨率切片(InternVL 思路) (2) 滑动窗口 + 全局摘要 (3) 多尺度 ViT 编码。各自适合不同场景:文档场景 → 切片;场景理解 → 多尺度。

9. 常见疑问 FAQ(精读者撰写)

没有 A100,只有 4090,能跑得动吗?

7B 模型 fp16 推理 24GB 够;微调建议用 LoRA + 4-bit 量化,可在单卡 4090 上跑通 7B LoRA。13B 起需要 2 卡或 offload 到 CPU。

中文场景效果不好怎么办?

优先选 Qwen-VL / InternVL-Chinese 等国内团队模型,英文模型(LLaVA/CogVLM)中文场景需要额外指令微调。

论文复现总差 1-2 个点正常吗?

非常正常,可能原因:数据预处理细节、batch size、随机种子、评测脚本版本。能稳定复现到 ±2pp 已经说明你掌握了核心。

精读论文库

精选 2,850 篇多模态论文,按工业界与学术界关注度深度清洗

论文标题 / 核心摘要
来源 / 年份
社区互动
LLaVA: Visual Instruction Tuning
NeurIPS 2023 (Oral) 引用: 4.2k

Visual Instruction Tuning (LLaVA)

视觉指令微调

Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee | UW-Madison, Microsoft Research


AI 课代表总结

“如何让瞎子大语言模型(LLM)睁开眼睛看世界?”

LLaVA 的回答极其暴力且优雅:既然 GPT-4 这么聪明,我们干脆把图片的文字描述(Bounding Box、Caption)丢给 GPT-4,让它发挥想象力“脑补”出各种看图说话的问答对。然后,用最基础的线性层(Linear)把视觉特征直接强塞进大模型的脑子里,拿这些问答数据去训练。

结论是:仅仅靠这种极简架构和“白嫖” GPT-4 构造的数据,多模态模型的对话能力直接起飞,成为了后来大半个工业界都在抄的标杆方案。

核心创新点

1 破局的数据工程

首创使用纯文本大模型(GPT-4)将现有的图文匹配数据集转换成了高质量、多样化的「多模态指令跟随数据」,省去了极其昂贵的人工标图成本。

2 极简的连接器

抛弃了复杂的 Q-Former,直接用一个简单的线性投影矩阵(Linear Projection)把 CLIP 提取的视觉 Token 投射到 LLaMA 的语言维度,即插即用。

核心架构

架构可以用一个公式概括:CLIP ViT-L/14(眼睛) + Linear Layer(视神经) + Vicuna(大脑)

LLaVA Architecture
伪代码一览:
# 视觉特征对齐只需要这简单一步
vision_features = CLIP_Encoder(images)
mapped_features = nn.Linear(vision_features) # 这就是全部的多模态桥梁

# 拼接送入语言模型
inputs = concat(mapped_features, text_tokens)
output = LLaMA(inputs)

打榜效果

在 ScienceQA 数据集上,LLaVA 的表现不仅远超此前的 BLIP-2,甚至通过结合 GPT-4 的文本判断,达到了当时的最优水平。

评测模型 ScienceQA (准确率)
BLIP-2 61.0%
OpenFlamingo 71.6%
LLaVA (Ours) 92.5%

灵魂拷问

Q

这么简单的 Linear 层,凭什么能搞定复杂的多模态特征融合?

A
大道至简。其实大模型(LLaMA)本身的特征空间极其庞大,它的理解能力是溢出的。只要在“预训练对齐”阶段(Phase 1),我们喂给它海量的 Image-Caption 数据,让这个简单的 Linear 层学会“什么像素对应什么词汇”,这就足够成为 LLM 睁眼看世界的视神经了。复杂的连接器(比如 Q-Former)反而容易阻碍梯度的直接回传。
Q

如果不买 GPT-4 API,我自己还能复现 LLaVA 的数据构造过程吗?

A
很难达到相同的质量。LLaVA 的护城河其实是它的 150K 多模态对话数据集。如果你只是想跑通训练流程,可以直接下载开源的 LLaVA-Instruct-150K。如果非要造自己的域内数据(比如医疗),建议利用现有的开源模型(如 Qwen-VL)去反向生成描述,作为 GPT-4 的平替。
Q

它在真实工业场景里好用吗?有什么缺陷?

A
V1 版本的缺陷非常明显:它看不清字。因为它的视觉编码器直接把输入图片暴力缩放成了 224x224(后升级为 336x336)。你要是给它喂一张财报或者代码截图,上面的小字全糊了。这就是为什么后续必须看 LLaVA-1.5 里的 AnyRes 机制以及 Qwen-VL 引入的动态高分辨率切块技术。

开源项目 GitHub

数据源:GitHub · 排序依据:Star / Trending / 更新时间 · 仅收录"可运行的工程代码"(训练 / 推理 / Agent / 评测等)

hiyouga / LLaMA-Factory

Trending 38.2k 4.7k

最受欢迎的开源 LLM/VLM 训练微调框架之一,支持 100+ 模型(含 Qwen-VL、LLaVA、InternVL)的 SFT/DPO/PPO/ORPO,提供 WebUI 一键启动,是中文社区做多模态指令微调的事实标准。

Python
Updated 2 hours ago | 训练框架 SFT/DPO

vllm-project / vLLM

32.4k 4.2k

以高吞吐量和低显存占用著称的大模型推理引擎,首创 PagedAttention。目前已全面支持 LLaVA、Qwen2-VL、InternVL 在内的主流多模态模型的高效推理,是工业界做多模态大模型线上部署的首选方案。

Python
C++
Updated 4 hours ago | 推理引擎 PagedAttention

open-compass / VLMEvalKit

2.8k 380

上海 AI Lab 推出的多模态大模型一站式评测工具包,覆盖 80+ Benchmark(MMMU / MMBench / MathVista 等),仅需一行命令即可在 30+ 主流 VLM 上完成全套测试,是论文复现与打榜的标配。

Python
Updated 1 day ago | 评测工具 Benchmark

开源模型 🤗 HuggingFace

数据源:HuggingFace Hub · 排序依据:Downloads / Likes / 最新发布 · 仅收录"可加载的权重文件",含量化版本与 LoRA

🤗

Qwen / Qwen2-VL-7B-Instruct

编辑精选
2.4M / 月 1.6k

阿里通义开源的多模态大模型旗舰版本,支持原生分辨率与视频理解,在 MMMU、MathVista、DocVQA 上均接近 GPT-4o 水平,是当前中文多模态社区最常用的 base model。

7B VLM Apache-2.0 商用友好 | 关联论文:Qwen2-VL Technical Report · 已收录 8 个量化版本 (GGUF / AWQ / GPTQ)
🤗

OpenGVLab / InternVL2_5-38B

Trending
380k / 月 720

上海 AI Lab 最新发布的旗舰级 VLM,使用 InternViT-6B + InternLM2.5-32B,在 OpenCompass 多模态榜单达到开源 SOTA,已在 MMMU 上突破 70 分。

38B VLM MIT 商用友好 | 关联论文:InternVL2.5 Tech Report · 已收录 12 个量化/分片版本
🤗

HuggingFaceTB / SmolVLM-Instruct

NEW
210k / 月 480

HuggingFace 官方推出的 2B 级别端侧 VLM,5GB 显存即可推理,是入门多模态部署、做边缘 demo 的最佳选择。

2B VLM Apache-2.0 端侧友好 | 关联项目:smolvlm-finetune (GitHub)

数据集 🤗 HuggingFace

数据源:HuggingFace Datasets + 编辑收录 · 覆盖预训练、指令微调、评测、偏好对齐四大用途

laion / laion2B-en

编辑精选
1.1M / 月 引用 1.2k 篇

大规模 image-text 对齐数据集,2.32B 英文图文对,是 Stable Diffusion / CLIP 系列预训练的事实标准来源。

2.32B 样本 预训练 Image-Text CC-BY-4.0

Lin-Chen / ShareGPT4V

280k / 月 引用 320 篇

由 GPT-4V 生成的 1.2M 高质量图像描述,是当前训练 VLM 时最广泛使用的指令对齐数据,显著提升模型描述细节能力。

1.2M 样本 指令微调 Image-Text 仅研究

MMMU / MMMU

Benchmark
95k / 月 引用 800 篇

Massive Multi-discipline Multimodal Understanding,覆盖 6 大学科 30 个子领域 11.5k 道大学水平多模态题目,是衡量 VLM 综合能力的金标准。

11.5k 样本 评测 Image-Text Reasoning Apache-2.0
编辑精选 预训练

laion / laion2B-en

大规模 image-text 对齐数据集 · 2.32B 英文图文对,从 Common Crawl 中抽取并经过 CLIP 过滤。Stable Diffusion / OpenCLIP 等开源底模型的标配预训练集。

1.1M 总下载 引用 1.2k 篇 约 240 TB CC-BY-4.0
样本数
2,322,161,808
模态
Image + Text (URL)
语言
English
最近更新
2024-08

使用此数据集的关键论文

CVPR'22
High-Resolution Image Synthesis with Latent Diffusion Models
Stable Diffusion 原论文 · 用于训练 LDM 的 image-text 对齐
ICML'23
OpenCLIP: Reproducible CLIP Models
使用 LAION-2B 复现并扩展 CLIP,验证 scaling law
NeurIPS'23
DataComp: In Search of the Next Generation of Multimodal Datasets
以 LAION 为基线评估多模态数据筛选方法

数据集说明

LAION-2B 是 LAION-5B 的英文子集,由德国非营利组织 LAION e.V. 维护。每条样本包含一对 (image_url, alt_text),并附带 CLIP 相似度分数、NSFW 标签、watermark 概率等元数据。

构造流程:从 Common Crawl 抽取 HTML → 提取 (img.src, img.alt) 对 → CLIP 过滤(保留相似度 ≥ 0.28)→ 去重 → 元数据标注。

已知问题:含有少量 NSFW / 版权争议样本,使用前需按字段过滤;图片以 URL 形式提供,需自行下载且部分链接已失效(约 8%)。

BibTeX 引用

@inproceedings{schuhmann2022laion,
  title={LAION-5B: An open large-scale dataset for training next generation image-text models},
  author={Schuhmann et al.},
  booktitle={NeurIPS Datasets},
  year={2022}
}
关联资源
📦 关联模型:stabilityai/stable-diffusion-2
🔧 关联项目:rom1504/img2dataset
📄 关联论文:LAION-5B (NeurIPS'22)

顶会追踪雷达

一站式追踪 CCF-A 及国际顶级 AI 学术会议节点,数据 24h 自动校准

等级
会议名称 / 全称
当前状态
时间节点与倒计时
正在加载会议数据...

多模态竞技场

持续整理 Kaggle 及各大会议 Workshop 多模态评测挑战赛,关键字段以官方页面为准

赛事名称 / 举办方
总奖金池
参赛规模
截止时间
正在加载赛事数据...

加入社群

非营利学习社群 · 同辈互助 · 顶会同行群 · 完读特定论文后解锁

主社群(开放加入)

700+ 多模态学习者 · 周末论文 club · 群内不允许任何商业推广

✅ 已解锁,扫码加入社群

解锁条件防止 zero-effort 加群,提升群内浓度

NeurIPS 2026 中国群

主会议中签者参会同行交流 · 仅限有 paper accept 学者

CVPR 2026 同行群

线下参会者建群 · 同酒店 / 同 session

💬 V1 不开放站内评论 / 关注 / 私信功能 · 讨论请到上述群组
📩 站长邮箱:yzatlas.cn at outlook.com