登录研知星途
登录后可同步书签与邮箱验证状态。
邮箱注册
请使用邮箱创建账号;密码至少 8 位。
研知星途 ·
AI 科研辅导与科研情报平台
研知星途(yzatlas.cn)面向高校学生、研究人员与企业研发团队,提供论文选题辅导、方法实现指导、实验设计与写作支持等个性化科研辅导方案,并实时聚合顶会论文、开源项目、模型数据集与会议征稿信息,助力研究者高效追踪前沿。
24h 社区热榜
论文趋势 · Top 5 方向
每日 06:30 更新点击折线 / 图例 / 飙升 chip 跳转论文库并自动筛选该方向
核心论文串讲
开源项目
热门开源模型
热门数据集
顶会截稿雷达
竞赛追踪节点
MLLM 学习路线
4 阶段 · 预估学习周期 8–12 周 · 每阶段 9 个内容区块
本 Stage 共包含 9 个内容区块,建议按顺序阅读;最后通过 FAQ 自检学习效果。
1. 背景介绍 · 学完后能做什么
多模态对齐是把视觉特征"塞进"语言模型的艺术。LLaVA 用最简单的线性投影就做到了令人惊讶的效果;Qwen-VL / InternVL 则在此基础上做了 resampler、动态分辨率等工程优化。
- 独立跑通 LLaVA-1.5 inference,理解每行代码做什么
- 在 100 张自定义图上用 LoRA 微调,得到能"看懂"的模型
- 解释 Q-Former、Linear Projection、Cross-Attention 三种对齐方式的取舍
2. 前置依赖
3. 必读论文 · 阅读顺序
4. 必看资源(博客 / 视频 / PPT)
6. 动手练习 · 三阶难度
7. 检查点问题(展开看答案)
为什么 LLaVA 用线性投影就够?
CLIP 的视觉特征已经在大规模图文对上对齐到了语言空间;线性投影只需做最后一步"维度对齐"即可,不需要复杂的 cross-attn。这也是 LLaVA 用极小训练量出效果的核心原因。
Resampler(Q-Former)解决什么问题?
压缩视觉 token 数量,从 ViT 输出的 576 个降到 32-64 个,降低 LLM 上下文压力;同时学习 task-aware 表征。代价:训练复杂度上升,需 instruction tuning 数据更精细。
高分辨率处理有哪些方案?
三类:(1) 动态分辨率切片(InternVL 思路) (2) 滑动窗口 + 全局摘要 (3) 多尺度 ViT 编码。各自适合不同场景:文档场景 → 切片;场景理解 → 多尺度。
8. 进阶阅读 · 拓展方向
9. 常见疑问 FAQ(精读者撰写)
没有 A100,只有 4090,能跑得动吗?
7B 模型 fp16 推理 24GB 够;微调建议用 LoRA + 4-bit 量化,可在单卡 4090 上跑通 7B LoRA。13B 起需要 2 卡或 offload 到 CPU。
中文场景效果不好怎么办?
优先选 Qwen-VL / InternVL-Chinese 等国内团队模型,英文模型(LLaVA/CogVLM)中文场景需要额外指令微调。
论文复现总差 1-2 个点正常吗?
非常正常,可能原因:数据预处理细节、batch size、随机种子、评测脚本版本。能稳定复现到 ±2pp 已经说明你掌握了核心。
精读论文库
精选 2,850 篇多模态论文,按工业界与学术界关注度深度清洗
开源项目 GitHub
数据源:GitHub · 排序依据:Star / Trending / 更新时间 · 仅收录"可运行的工程代码"(训练 / 推理 / Agent / 评测等)
hiyouga / LLaMA-Factory
最受欢迎的开源 LLM/VLM 训练微调框架之一,支持 100+ 模型(含 Qwen-VL、LLaVA、InternVL)的 SFT/DPO/PPO/ORPO,提供 WebUI 一键启动,是中文社区做多模态指令微调的事实标准。
vllm-project / vLLM
以高吞吐量和低显存占用著称的大模型推理引擎,首创 PagedAttention。目前已全面支持 LLaVA、Qwen2-VL、InternVL 在内的主流多模态模型的高效推理,是工业界做多模态大模型线上部署的首选方案。
open-compass / VLMEvalKit
上海 AI Lab 推出的多模态大模型一站式评测工具包,覆盖 80+ Benchmark(MMMU / MMBench / MathVista 等),仅需一行命令即可在 30+ 主流 VLM 上完成全套测试,是论文复现与打榜的标配。
开源模型 🤗 HuggingFace
数据源:HuggingFace Hub · 排序依据:Downloads / Likes / 最新发布 · 仅收录"可加载的权重文件",含量化版本与 LoRA
Qwen / Qwen2-VL-7B-Instruct
编辑精选阿里通义开源的多模态大模型旗舰版本,支持原生分辨率与视频理解,在 MMMU、MathVista、DocVQA 上均接近 GPT-4o 水平,是当前中文多模态社区最常用的 base model。
OpenGVLab / InternVL2_5-38B
Trending上海 AI Lab 最新发布的旗舰级 VLM,使用 InternViT-6B + InternLM2.5-32B,在 OpenCompass 多模态榜单达到开源 SOTA,已在 MMMU 上突破 70 分。
HuggingFaceTB / SmolVLM-Instruct
NEWHuggingFace 官方推出的 2B 级别端侧 VLM,5GB 显存即可推理,是入门多模态部署、做边缘 demo 的最佳选择。
数据集 🤗 HuggingFace
数据源:HuggingFace Datasets + 编辑收录 · 覆盖预训练、指令微调、评测、偏好对齐四大用途
laion / laion2B-en
编辑精选大规模 image-text 对齐数据集,2.32B 英文图文对,是 Stable Diffusion / CLIP 系列预训练的事实标准来源。
Lin-Chen / ShareGPT4V
由 GPT-4V 生成的 1.2M 高质量图像描述,是当前训练 VLM 时最广泛使用的指令对齐数据,显著提升模型描述细节能力。
MMMU / MMMU
BenchmarkMassive Multi-discipline Multimodal Understanding,覆盖 6 大学科 30 个子领域 11.5k 道大学水平多模态题目,是衡量 VLM 综合能力的金标准。
laion / laion2B-en
大规模 image-text 对齐数据集 · 2.32B 英文图文对,从 Common Crawl 中抽取并经过 CLIP 过滤。Stable Diffusion / OpenCLIP 等开源底模型的标配预训练集。
使用此数据集的关键论文
数据集说明
LAION-2B 是 LAION-5B 的英文子集,由德国非营利组织 LAION e.V. 维护。每条样本包含一对 (image_url, alt_text),并附带 CLIP 相似度分数、NSFW 标签、watermark 概率等元数据。
构造流程:从 Common Crawl 抽取 HTML → 提取 (img.src, img.alt) 对 → CLIP 过滤(保留相似度 ≥ 0.28)→ 去重 → 元数据标注。
已知问题:含有少量 NSFW / 版权争议样本,使用前需按字段过滤;图片以 URL 形式提供,需自行下载且部分链接已失效(约 8%)。
BibTeX 引用
@inproceedings{schuhmann2022laion,
title={LAION-5B: An open large-scale dataset for training next generation image-text models},
author={Schuhmann et al.},
booktitle={NeurIPS Datasets},
year={2022}
}
顶会追踪雷达
一站式追踪 CCF-A 及国际顶级 AI 学术会议节点,数据 24h 自动校准
多模态竞技场
持续整理 Kaggle 及各大会议 Workshop 多模态评测挑战赛,关键字段以官方页面为准
加入社群
非营利学习社群 · 同辈互助 · 顶会同行群 · 完读特定论文后解锁
主社群(开放加入)
700+ 多模态学习者 · 周末论文 club · 群内不允许任何商业推广
✅ 已解锁,扫码加入社群
解锁条件防止 zero-effort 加群,提升群内浓度
NeurIPS 2026 中国群
主会议中签者参会同行交流 · 仅限有 paper accept 学者
CVPR 2026 同行群
线下参会者建群 · 同酒店 / 同 session
💬 V1 不开放站内评论 / 关注 / 私信功能 · 讨论请到上述群组
📩 站长邮箱:yzatlas.cn at outlook.com