
刻下端侧多模态大模子普遍濒临性能不及、材干有限、适配性差等问题,难以闲适端侧对高性能、强隐讳、低蔓延的需求,成为制约下一代 AI 手机发展的要津。
为此,OPPO AI 中心推出开源的全链路适配的端侧多模态大模子 AndesVL。该模子兼具 SOTA 水平的通用多模态意会推理材插手端侧专项上风,含 0.6B-4B 四档尺寸套件,赞成多场景纯真部署,还具备强 GUI 与多言语材干,更将全面开源。其通过先进技巧达成端侧效果与遵守平衡,为端侧多模态大模子应用树标杆,助力 AI 手机等场景创新。AndesVL具有通用材干强、端侧材干专、适用范围广、端侧部署好、端测试配快等诸多上风。AndesVL浮点数模子在多个领域共30余个benchmark上取得临近尺寸模子的SOTA效果,端侧部署的模子达成高达6.7倍的峰值解码加快比以及1.8BPW的压缩遵守。
技巧布景
频年来,多模态大模子已在云表各种场景的应用中取得显赫得胜,而如安在智妙手机等终局开采上充分阐述多模态大模子的材干,是下一代AI手机能否得胜的要津。端侧应用亟需多模态大模子具备高性能、强隐讳、低蔓延的材干,但面前的端侧多模态大模子普遍存在性能不及、材干有限、适配性差的问题。
为此,OPPO AI中心大模子算法团队推出洋内首个全链路适配的端侧多模态大模子——AndesVL。该系列模子不仅具备世俗适用的SOTA水平的多模态意会和推理材干,还达成了端侧化部署与业务场景应用的无缝对接,或者快速部署、加快推理并世俗应用于智能AI手机等端侧场景。全系列模子包含0.6B至4B四个道路尺寸的套件,赞成不同资源环境下的竖立与应用。除具备通用多模态识别、意会和推理材干外,AndesVL还具有浩繁的GUI材干和多言语材干,全面适配各样化、人人化的手机端侧应用。此外,AndesVL将全面开源,为端侧多模态大模子的部署与应用缔造标杆,同期促进产业内关连技巧和应用的全面快速发展。
具体而言,AndesVL主要有以下几个亮点:
通用材干强:AndesVL对比同参数限制的开源模子在公开评测集上笼统达到SOTA水平、30多个评测集上达到Top1的精度,材干涵盖数学推理材干、OCR识别材干、图文意会和学问材干、多图意会以及幻觉驾御等。端侧材干专:AndesVL针敌手机端侧的多言语、GUI意会需求进行专项普及,使模子兼顾通用材干的同期,在这两项端侧关连材干上也达到SOTA。适用范围广:为闲适不同资源驾御和各样性应用的需求,AndesVL提供0.6B、1B、2B、4B共4个道路尺寸的模子组合套装。同期,提供各尺寸模子的Instruct版和Thinking版模子,兼顾遵守和效果,既适用于高效的意会生成应用需求也能应付复杂的数学推理盘算推算应用的挑战。端侧部署好:基于先进的稀少化技巧、量化感知磨砺技巧和编解码加快技巧,达成端侧效果和遵守的完好意思平衡,达成从云表模子到端侧模子的跨越。端侧适配快:以1+N LoRA架构赞成多场景部署,以QALFT技巧达成场景孤立迭代更新,端侧也能达成和云表一样的高效纯真。


模子架构


AndesVL是面向本色端侧部署开发的大模子,因此从架构想象起,就笼统研讨模子材干和端侧资源、功耗驾御的平衡。为得当不同资源驾御下的端侧化运行场景,AndesVL 系列模子在长入的架构模式下具备参数范围从0.6B到4B的4个不同尺寸模子,每个模子具有Instruct和thinking两个版块。长入的架组成心于模子的快速开发迭代和部署应用,不同的模子尺寸得当不同的需乞降资源驾御场景,而通用指示版和推理版能分袂应付通用指示扩充和强推理的不同应用场景需求。
具体而言,模子结构包括三部分:视觉编码器(ViT)、多层感知器(MLP)和大言语模子(LLM)。视觉编码器的选型上,1-4B版块的弃取AimV2-300M,比较更大、更复杂的编码器(如 Qwen2VL-ViT),其尺寸和架构想象在功耗和部署适配性上都更得当端侧使用;应付0.6B模子部署资源驾御更为严格的要求,则弃取更小尺寸的SigLIP-2-base 动作视觉编码器,在保证效果的同期尽可能减少资源耗尽。在基础的视觉编码器上,AndesVL 加入了二维旋转位置镶嵌(2D-RoPE),借助其外推材干,使模子能灵验处理陡立不同分辨率图像的输入。此外,视觉编码器基于Native Resolution ViT(NaViT) 计策径直处理轻易分辨率的输入,能高效处理轻易宽高比和分辨率的图像,同期弃取像素重排 (pixel shuffle) 无损压缩序列长度,提高处感性能。 在大言语模子部分,AndesVL弃取老练的Qwen3系列言语模子,以赞成Instruct和Thinking两种模式的模子达成。
磨砺有筹画
1、预磨砺阶段
AndesVL 的预磨砺阶段包含三个法子:视觉-言语对皆、视觉-言语议论预磨砺和多任务预磨砺:

视觉-言语对皆
该阶段磨砺除进行视觉模态到言语模态的对皆外,重心磨砺以充分阐述新引入的二维旋转位置镶嵌的潜能。磨砺第一阶段使用大宗低分辨率数据(最高 896×896 像素)进行预磨砺;第二阶段则在此基础上继续使用更高分辨率数据(最高1792×1792 像素)进行微调。为保捏言语模子结识性,该阶段主要使用的数据为图像形容(Captions)、光学字符识别(OCR)数据和视觉问答(VQA)等较为通用的视觉言语对皆数据。
视觉-言语议论预磨砺
视觉-言语议论预磨砺阶段解冻 LLM 的参数,并以相对较低的学习率进行全参数预磨砺,同期此阶段将 LLM 的陡立文窗口从 2,048 膨胀到 8,192。
这一阶段的磨砺数据主要由图文交错的数据组成,这将传统的纯文本预磨砺膨胀为包含图像输入的状貌。为了保留模子的纯文本处理材干,普及指示意会材干和基本的视觉意会材干,他们在磨砺中也混入了一部分纯文本数据、一定数目的VQA数据和第一阶段顶用于视觉-言语对皆的数据。为在意单向自记忆的 Transformer 中图像出当今序列末尾时导致无法灵验学习的问题,磨砺时弃取立时位置替换的样式,即以 50% 的概率立时将图像从原始位置提前至文本内容之前,并用对应的索引代替原图像位置。
比较于Instruct版的磨砺,Thinking版模子从此阶段起就运行引入大宗长推理数据,包括图文羼杂的长推理数据和纯文本的长推理数据,在保捏原LLM的数学推理材干的同期,激活多模态模子的长推理材干。
多任务预磨砺
在此阶段,AndesVL使用标注数据的有监督学习,并专注于对谜底部分的文本token计较失掉。这一阶段的主要数据类型包括通用的视觉问答(VQA)、图像形容(Captions)、光学字符识别(OCR)数据和图文长推理数据,同期也引入了特定任务的数据,举例定位(Grounding)和用户界面(GUI)关连数据。雷同的,这个阶段的Thinking模子也引入了大宗的长推理数据。为了更好地学习高分辨率数据中的信息,在此阶段将 ViT 的图像块输入长度从4,096 加多到了 16,384。同期LLM的序列长度也从8,192膨胀到32,768。

2、后磨砺阶段
AndesVL的后磨砺主要应用的技巧包括:监督微调 (SFT)和强化学习对皆(RL)。其中RL阶段对Instruct模子和Thinking模子分袂使用羼杂偏好优化 (MPO)和GRPO。因而后磨砺数据包含三部分,通用的微调数据、MPO数据和GRPO数据。
监督微调
监督微调的通用数据集经过经心想象,或者将多种输入模态引入模子,从而增强浩繁的表征学习材干。该数据集涵盖了多种任务方针,举例图像形容、图像问答、文本纲领、代码生成等。

监督微调数据经过多阶段的数据过滤经过,包括单模态过滤、任务聚类及基于LLM的评分机制,最终构建了一个包含约1600万条数据的高质料微调数据集。
羼杂偏好优化
径直偏好优化(DPO)已成为将大言语模子(LLM)与东谈主类偏好对皆的主流要领,由于其在言语模子对皆中的邃密发扬,近期一些接洽已将 DPO 应用于多模态场景中。但是,在多模态大言语模子中应用 DPO 仍濒临两大挑战:一是费解全面且高质料的多模态推理偏好数据集,二是 DPO 自身无法评估单个回话的透彻质料。为应付这些问题,InternVL团队提议了一种新的要领——羼杂偏好优化(MPO),该要领已在多个多模态推理评估任务中展现出更优的性能发扬。
AndesVL弃取了MPO的磨砺要领,并针对性想象了数据构造pipeline,由此生成了大宗MPO磨砺数据,劝诱开源数据MMPR,显赫普及了模子的举座材干。

GRPO磨砺
凭证DeepSeek的实验论断,小模子不错从大模子中给与念念维链的推理材干,因此AndesVL弃取了数据蒸馏的样式,通过想象数据构造的pipeline来大宗量获取高质料的多模态长念念维链数据。
鉴戒Qwen3念念考模式切换的想象念念路,AndesVL弃取了两类数据集:一种包含翔实推理法子的“有念念考过程”数据集,另一种不祥推理过程的“无念念考过程”数据集。这种计策使得模子不错在念念考和不念念考之间纯深入换。
GRPO阶段咱们弃取多模态推理数据和纯文本推理数据的两阶段磨砺有筹画,同期凭证数据难度从易到难作念课程学习充分引发模子的推理材干,使其在数学推理等领域的效果大幅普及,同期保捏非推理领域的效果。
端侧部署科罚有筹画:算法优化与高效部署的创新实践
为应付端侧AI限制化落地的挑战,OPPO基于自研的AndesVL多模态模子,构建了一套从底层算法优化到表层部署架构的完整技巧有筹画。该有筹画聚焦于算法优化与端侧部署两大标的,通过在模子压缩与架构想象上的协同创新,达成了推理遵守、部署纯真性与迭代经济性的显赫普及。
1、算法优化:稀少化+QAT,奠定高效部署基石
在算法层面,咱们通过前沿的稀少化压缩与量化感知磨砺技巧,从源流削减模子的计较与存储支拨,同期劝诱先进编解码算法,为端侧高效推理奠定坚实基础。
模子稀少化压缩:摧毁75%稀少度,BPW低至1.8+bit
咱们达成了大言语模子稀少化技巧的要津摧毁。OPPO与联发科议论优化模子端侧内存压缩技巧,通过算法与硬件的协同想象,在极小的效果失掉前提下,将模子权重稀少度普及至75%以上,平均每参数比特数(BPW)得胜降至1.8bit以下,劝诱联发科天玑9500芯片的硬件内存压缩技巧,OPPO达成模子端侧内存占用裁汰30.9%,推理速率普及45%。得胜在压缩率、推理速率与精度保捏之间达成了高效平衡。
量化感知磨砺(QAT):构建从磨砺到部署的可预测通路
咱们构建了遮蔽基模子与场景LoRA的双分量化感知磨砺体系,确保量化模子在端侧的效果可靠性与迭代遵守。
基模子QAT框架:赞成权重(W2/W3/W4/W8)与激活(A8/A16)的细粒度羼杂精度竖立。其中枢创新在于建造了从“静态QAT磨砺”到“端侧PTQ收尾”的无缝映射机制,灵验摒除了因校准数据散布相反等身分引入的精度波动,大幅普及了模子在真实硬件上的发扬信托性与结识性。QALFT框架(Quantization-Aware LoRA Fine-Tuning):在“1+N LoRA”架构下,不同的场景LoRA会产生不一样的激活范围,这导致基模子在量化过程中必须研讨通盘场景的激活范围才能保证最好的量化效果,因此飞速景发生更新或新增时,都需要对基模子再行量化,这影响了端侧模子的部署和迭代的遵守。为了科罚上述问题,咱们与联发科议论开发了端侧LoRA量化感知磨砺框架QALFT(Quantization-Aware LoRA Fine Tuning)。该技巧通过在云表仿真端侧已经量化好的基模子的计较收尾,达成对场景LoRA进行量化感知磨砺,让场景LoRA在磨砺阶段拟合端侧已经产生的量化纰谬。基于QALFT框架,确凿达成了场景的新增和更新彼此孤立,普及端侧部署遵守与纯真性,并最猛进程保证端上的算法效果。

QALFT框架的中枢念念想是模子、数据、磨砺器三方解耦,各组件可在不同磨砺经过中复用。同期,Runtime库与表层设施荆棘,保证磨砺经过不错在不同平台快速挪动。通过使用QALFT磨砺套件,咱们不错快速在MTK硬件平台上进行模子磨砺和部署。
编码压缩与解码加快:摧毁长陡立文与自记忆生成瓶颈
为克服长文本输入与自记忆生成带来的端侧推理蔓延,咱们针对LLM的推理经过进行了深度优化。
编码压缩:针对长教导下键值缓存(KV Cache)内存暴涨的业界艰苦,咱们基于长文本特征稀少的特质,研发了端侧专用编码加快有筹画OKV。该有筹画通过对KV缓存进行智能稀少化,在仅保留25%缓存的条目下,效果即可比好意思全量缓存,同期得胜在端侧赞成了高达128K的陡立文长度,为用户流通的长文本交互体验提供了中枢技巧保险。解码加快(投契解码):为破解自记忆解码的串行瓶颈,普及端侧模子的能耗遵守,咱们整合校正了EAGLE-2、HASS等前沿投契解码算法,劝诱OPPO的模子压缩算法,AndesVL的峰值解码加快比达到6.7倍,显赫普及了端侧AI的反馈速率。
2、端侧部署:1+N LoRA架构达成低本钱、高纯果真限制化膨胀
在部署架构层面,咱们创新性地弃取了 “1+N LoRA” 计策,以一个浩繁的多模态基模子劝诱多个轻量级、可插拔的场景专用LoRA模块,灵验应付端侧开采资源受限与场景各样化的双重挑战。
该架构允许在运行时动态加载不同的LoRA来扩充相应任务,不仅显赫裁汰了新增功能所需的存储空间与更新本钱,更使得OPPO或者基于归并基模子,快速发布并迭代多款运行于AI开采上的端侧应用,达成了高效、经济的限制化部署与敏捷迭代。
评测收尾
1、举座材干

上表展示了不同多模态大模子 (MLLM) 在学术基准测试中的翔实评估收尾。4B-Thinking 模子70.9 分,比第二名InternVL3.5-4B 高出 3.2 分。在6大垂直领域,AndesVL-4B均取得第一的分数,透表示其在各式多模态场景下的突出性能。4B-instruct 在多个垂直领域雷同发扬出色,尤其是在多图像意会和多言语任务。AndesVL-2B-Thinking总分64.4,在同限制模子中排行第一,其在多图像意会和幻觉缓解方面性能杰出。1B和0.6B模子上风赫然,thinking和instruct模子分袂位列同尺寸前两名。绝顶是0.6B模子,比较InternVL3.5-1B等各大尺寸的模子,也具有一定上风。
这些收尾突显了AndesVL系列模子在处理一系列需要多模态感知、意会和推理的试验寰球任务方面的出色材干。同期,0.6B-4B的各样性的尺寸范围劝诱其浩繁的多模态材干,AndesVL极端得当应用于各种场景,绝顶是计较资源紧缺的手机出动场景。
2、垂域材干
数学和逻辑推理材干

AndesVL-4B-Thinking在各种数学与推理基准测试中以58.3的笼统得分位居榜首,绝顶是在MathVista、MathVerse和WeMath基准测试中较先进模子展现出显赫上风。AndesVL-2B-Thinking模子以45.7的笼统得分位列第二,与最高分49.9极端接近。此外,AndesVL的1B和0.6B模子在各自限制组别中仅在笼统得分上最高,何况在大多数单项基准测试中亦然第一。
这些收尾印证了磨砺计策的灵验性:在预磨砺阶段利用大限制、优质的长链念念维链多模态数据激活推理材干后,在后磨砺阶段通过强化学习显赫增强了模子的视觉-文本议论推理材干。
视觉文本意会材干

AndesVL4B-Thinking模子以86.0的笼统得分在视觉文本任务中夺得第一,并在八项基准测试中的四项取得最好获利。雷同,AndesVL-4B-Instruct也取得84.8的优异发扬。绝顶在ChartQA上,AndesVL-4B-Thinking模子取得90.4分,以4.4分的上风显赫超越此前最好模子InternVL3.5-4B(86.0)。在DocVQA基准测试中雷同不雅察到近似的显赫上风。由于ChartQA和DocVQA都所以长文本图像和复杂问题组成,这个收尾证据了AndesVL不仅或者准确识别长文本,更能欺诈高等推理材干灵验科罚具有挑战性的多模态问题。
关于更小尺寸的模子,AndesVL-2B-Instruct、AndesVL-1B-Thinking和AndesVL-0.6B-Instruct模子均在各自限制组别中夺得第一,展现出全系列模子的优秀视觉文本意会材干。
多图意会材干

AndesVL-4B 在多项多图像基准中发扬优异,取得67.8 的最高分。更小尺寸的模子依旧给与了4B模子的上风,0.6B模子得分53.1,比较1B模子无赫然精度着落。这一上风标明,AndesVL 弃取的先进预磨砺计策和增强的磨砺数据集,通过同期意会和分析多幅图像之间的关系,显赫普及了其捕捉和推理图像间关系的材干。
通用问答意会材干

AndesVL 模子(4B、1B 和 0.6B)在各自尺寸中取得了最好精度,2B 版块也取得极具竞争力的获利。翔实分析透露, AndesVL 在 MME 和 RealWorldQA 上展现出优异性能。这标明咱们的模子或者索取鲁棒图像特征,并展现出浩繁的真实场景意会材干,或者灵验地处理复杂且动态的任务。
幻觉驾御材干

AndesVL 各尺寸模子均排行第一,4B 和 0.6B 模子分袂得分74.8 和 65.9,与其他同尺寸模子比较有显赫上风,何况这种上风在更小尺寸模子上愈加赫然。这标明咱们的架构在保捏高精度的同期,还提供了优异的幻觉缓解材干,即使在最小的 0.6B 版块中也依旧如斯。
多言语意会材干

AndesVL 的 Thinking 和 Instruct 模子都展现出优异的多言语材干,取得 64.9 的最高分,比之前的最好模子 Ovis2-4B 高出 1.5 分。这种专科的多言语材干不错使模子的多模态材干或者挪动到多个语种,从而将应用膨胀到更世俗、更各样化的人人受众。
UI意会材干

AndesVL 模子在ScreenSpot和咱们自建的 AndesUI 评测集上均取得了发轫精度。这些收尾共同证明了AndesVL在 UI 意会和应用方面的丰富教养和独有的竞争上风。
3、on-device效果和性能评测
咱们在多个公开评测集进行端侧精度和推理速率的评测,展示OPPO在端侧模子精度优化和推理加快方面的后果。
量化感知磨砺

Top1-accuracy体现了模子在量化前后解码步履的一致性。咱们在端侧考证了经过量化感知磨砺(QAT)前后的Ansdes-VL-4B进行PTQ(W4A16)之后的精度,实验收尾透露OPPO自研的QAT磨砺框架不错显赫裁汰模子在端侧的量化失掉。
Cache Eviction

咱们得胜将自研的OKV端侧编码压缩有筹画应用在OPPO亮点功能-通话纲领上,不错看到在50%压缩率的实验条目下,比较SnapKV这依然典有筹画,模子在rouge-1筹画上普及绝顶10%。在25%压缩率下以致比好意思全量KV缓存效果。
Speculative Decoding

劝诱自研的投契解码算法、模子稀少化及联发科天玑9500芯片的硬件压缩技巧,在AndesVL-4B上,咱们达成了比无压缩优化的自记忆模子高达6.7倍的峰值解码加快比。通过极致的模子压缩,模子的BPW也大幅着落至1.8。
AndesUI benchmark
为增强 AndesVL 对智妙手机 UI 的意会材干,OPPO多模态大模子团队构建了一个专注于 UI 意会的数据集,名为 AndesUI。此数据集共收罗了 90 款应用,其中包括来自 OPPO 软件商店的 65 款热点下载应用,遮蔽用户高频使用的多个类别,以及 25 款 ColorOS 预装应用。标注东谈主员被要求截取每款应用中不同且具有异构特质的页面截图,确保每张截图包含独有的布局和内容。最终共收罗了来自第三方应用的 10000 张截图和来自 ColorOS 预装应用的 2500 张截图。
得到以上图片数据后东谈主工对每张截图中的通盘控件进行标注,包括绘图领域框、识别控件类型、纪录控件上可获取的笔墨内容、判断其是否可点击等信息。平均每张界面截图生成约 18 个控件,磨砺皆集推测包含 227000 个控件。
最终构建了基础与进阶两类数据。基础数据包括定位与指代抒发数据集,进阶数据则涵盖举座形容性数据和当然言语问答对。最终磨砺集共生成 227000 条指代抒发数据、186000 条定位数据、13000 条笼统形容数据以及 108000 条当然言语问答对。
数据示举例下:


模子输出示例
底下展示了AndesVL-4B模子在各个场景的输出示例:







将来瞻望
OPPO多模态大模子团队提议的Andes-VL从模子架构、磨砺要领、端侧部署、模子应用等多个方面提议了针对端侧多模态大模子磨砺部署应用的笼统科罚有筹画。刻下该模子在笼统效果、数学推理、GUI意会、多言语都达到了同量级模子的发轫水平,并开源关连模子鼓吹行业技巧绝顶。
将来该团队将会在视觉编码器科罚有筹画、后磨砺有筹画、学问蒸馏机制、交融文本视觉语音三模态的一体化模子等标的继续发力,信托OPPO将不断在手机端侧实践和应用这些技巧,给用户提供更安全、更快捷、更智能的交互体验,也将鼓吹通盘这个词行业向更高端倪的技巧翻新迈进。
