
该文章提出了InternSVG系列,通过整合数据集、基准测试和模型,实现了SVG理解、编辑和生成的统一建模,显著提升了SVG相关任务的性能。一、文章主要内容研究背景:当前SVG建模存在数据集碎片化、方法跨任务迁移性差、处理结构复杂性难的问题,现有数据集多针对单一任务,规模和多样性不足,模型泛化能力弱。核心方案:InternSVG系列SAgoge数据集:现有最大、最全面的多模态SVG数据集,含1600万训练样本,覆盖图标、插图、化学结构式、动画等领域,支持理解、编辑、生成三类任务。SArena基准测试:配套基准,标准化任务和评估指标,涵盖上述四大领域,确保评估的严谨性和可比性,含3.1万样本。InternSVG模型:基于多模态大语言模型(MLLM)的统一模型,通过SVG专用特殊 tokens、子词嵌入初始化和两阶段训练策略(从短静态SVG到长序列插图和复杂动画),实现三类任务的统一建模。实验结果:在SArena及以往基准测试中,InternSVG表现优于主流开源和专有模型。例如在SArena-Icon基准上,理解任务准确率超Claude-Sonnet-4约11%,编辑任务PSNR高34%,Text-to-SVG任务FID低56%。二、创新点