<!--more--> ## 零、写在前面 ## 一、摘要  摘要把 Qwen2.5-VL 定位为 Qwen vision-language 系列的最新旗舰模型,强调它在基础能力和新功能上都有提升。核心能力包括: - 更强的视觉识别与细粒度感知; - 使用 bounding boxes 或 points 进行精确 object localization; - …
<!--more--> ## 零、写在前面 Qwen2-VL做了以下升级:动态分辨率、跨模态位置编码、视频统一建模和 scaling。 ## 一、摘要 Qwen2-VL 被定义为 Qwen-VL 系列的升级版,**核心目标是突破传统视觉处理中的固定分辨率范式**。摘要中强调了三个主要技术点: 1. **Naive Dynamic Resolution**:模型可以根据图像原始分辨率动态生成不同数量的 visual tokens,而不是把所有图像强制缩放到同一固定尺寸。 2. **Multimodal Rotary Position Embedding, …
<!--more--> ## 零、写在前面 这篇主要就是在 LLaVA 框架下,通过少量但关键的设计改动,可以得到一个更强、更简单、数据效率更高的 Large Multimodal Model baseline,即 **LLaVA-1.5**。 ## 一、摘要  Abstract 针对 LMM 研究中的一个关键问题:现有方法越来越复杂,训练数据和算力规模越来越大,但哪些设计因素真正重要并不清楚。 …
<!--more--> ## 零、写在前面 > 无端联想:[【硬核科普】从零开始认识显卡](https://www.bilibili.com/video/BV1xE421j7Uv/?spm_id_from=333.337.search-card.all.click&vd_source=a7ce6b38365a0cb2ad96f0668de0bc51) lecture05 主要就是讲了讲GPU的架构,以及一些性能敏感的计算技巧。 ## 一、GPUs、TPUs ### 1.1 为什么 LLM 时代必须理解 GPU? > ** …
<!--more--> ## 零、写在前面 LLaVA 把 text-only LLM 中已经成功的 `instruction tuning` 思路迁移到 image-language 场景,提出 `visual instruction tuning`,并证明:用 GPT-4 生成的 multimodal instruction-following data,加上一个简单的 CLIP-to-Vicuna projection layer,就能训练出具备较强视觉对话和视觉指令跟随能力的开源模型。 **证明了 visual instruction tuning 是构建开源 LVLM 的 …
<!--more--> ## 零、写在前面 lecture04主要围绕两个主题: 1. **Attention alternatives:注意力机制的替代方案** - 为什么标准 attention 在长上下文下很贵? - Linear Attention、Mamba-2、Gated Delta Net、Sparse Attention 等思路如何降低成本? - 为什么很多新模型采用 attention + alternative module 的混合架构? 2. **Mixture of Experts,MoE:专家混合模型** - MoE 是什 …
<!--more--> ## 零、写在前面 B站上有论文一作作者做的汇报:[MiniGPT-4、表格推理、代码生成、生成式推理-来自斯坦福、北大、阿卜杜拉、达摩院的四位论文一作思辨大模型](https://www.bilibili.com/video/BV1n24y1F7kv/?spm_id_from=333.337.search-card.all.click)。大概十几分钟就能了解清楚本文的动机、技术路线。 MiniGPT-4 和 BLIP-2 的架构几乎一样,只是把llm侧用了更强的**Vicuna**(一个基于 LLaMA 微调的开源模型)。 本文提出 把一个 frozen …
<!--more--> ## 零、写在前面 BLIP-2 认为之前的VLP工作,把下游任务SOTA刷的越来越高,但是每次都要从零训练,而且成本也越来越高。所以通过引入QFormer,只需要训练QFormer,就可以把现成的视觉模型和语言模型拼在一起协同工作。 QFormer把图像压缩成几个关键的可学习的query,然后把这些query投影到语义空间,拼接在prompt前面喂给llm,从而引导语言模型看图说话。 这几天看了一车多模态的论文,本来要读 Qwen-VL、LLaVA、MiniGPT的,但发现前面这些多模态工作还真挺有必要看一下的。这个BLIP-2 证明了在 frozen …