ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

【必收藏】DeepSeek-OCR革命性突破:用视觉压缩解决大模型长上下文瓶颈,输入范式或将重构

【必收藏】DeepSeek-OCR革命性突破:用视觉压缩解决大模型长上下文瓶颈,输入范式或将重构 前言当我们谈论DeepSeek时很少会提及多模态。然而10月20日DeepSeek突然开源了DeepSeek-OCR。看起来它是一个OCR光学字符识别模型并且在OmniDocBench等权威基准上取得了SOTA业界顶尖的成绩。那它为什么要突然涉足OCR领域答案藏在当前大语言模型面临的最大挑战中长上下文处理的算力瓶颈。这篇论文的核心论点是文本信息可以通过光学2D映射即渲染成图像被高效压缩然后让VLM视觉语言模型从图像中解压出原始信息。简单来说就是将文本内容转换为图像形式用比等效数字文本少得多的视觉token来表示相同的信息。对此大神AndrejKarpathy也表示深受该论文启发感觉可能像素pixels是比文本text更好的LLM输入。还列举了这么做的四大好处信息压缩他明确引用了DeepSeek-OCR论文的观点这将带来“更短的上下文窗口和更高的效率”。更通用的信息流输入不再局限于纯文本还可以包含“粗体、彩色文本、任意图像”。更强的处理方式图像可以被“双向注意力”bidirectional attention轻松处理这比文本常用的自回归注意力“强大得多”。删除输入端的Tokenizer这是他最激动的一点。他借此强烈抨击了现有的分词器这个老大难问题。本文将深度解析这一构想探讨DeepSeek为何要用视觉这把锤子来敲文本这颗钉子。这一论文很有可能会用一图胜千言的模式改变以后LLM的整个输入范式。01名为OCR实为长上下文在LLM的世界里一切竞争的尽头似乎都是对“更长上下文”的追求。从几千token到几万再到今天的百万、千万token窗口这场军备竞赛从未停歇。其背后的根本制约源于Transformer架构的灵魂注意力机制。标准的全局注意力允许序列中的每一个token都看到所有其它token这赋予了模型强大的上下文理解能力。但在当前主流的自回归模型中这种能力的代价是高昂的因为每个token都要和前面所有token建立起乘积关系去预测下一个token因此其计算复杂度和内存占用随序列长度成二次方增长。尽管业界已经提出了分组注意力、多查询注意力、RoPE位置编码等优化技术来减少查询头的数量但这些方法本质上都是试图优化中的那个token计算的平方复杂性却从未真正减少token数量本身。DeepSeek-AI团队的工程师们显然注意到了这个房间里的大象。他们跳出了优化注意力计算的内卷提出了一个更根本的问题我们能不能把token数量本身给“压缩”掉这就是光学压缩Contexts Optical Compression的逻辑起点。想理解这个我们得先弄明白视觉token和文本token的不同。视觉token是视觉模型处理图像时所使用的基本信息单元。文本模型LLM阅读的是文本token单词或子词而视觉模型VLM观看的就是视觉token。在DeepSeek-OCR 论文中视觉token是先将高分辨率图像切割成小的图像块在编码过程中每个小图像块本身都会被转换成一个数字向量即一个token而这个向量就代表了该图像块的全部信息。因此一张1024*1024的图像就可以被划归成4096个视觉token。而大小为其一半的图像能容纳的文字量大概是10000个文本token。因此一张包含10000个单词的文档图像经过视觉化后的token量就少了一半再经过图像压缩则可能只需要几百个视觉token而如果以文本形式输入则需要10000多个文本token。这种“视觉模态天然就是文本信息的高效压缩媒介”的认知催生了DeepSeek-OCR这个项目。DeepSeek-OCR本质上是一个“光学压缩-解压”系统的概念验证。它试图回答一个根本性问题用多少个视觉token能够解压出多少倍的文本token这个问题的答案将直接决定“视觉压缩”作为长上下文解决方案的可行性。DeepSeek目前的方案实现了10倍压缩几乎无损20倍压缩基本可用。02DeepEncoder压缩的艺术要实现光学压缩团队需要一个前所未有的视觉编码器。它必须能处理高分辨率输入因为文本图像包含海量细节产生尽可能少的视觉token。同时这个过程中激活内存要够低否则就失去了优化的意义。论文明确指出当时所有的主流VLM架构如Vary、InternVL2、Qwen2-VL都无法同时满足这三点。为此DeepSeek-AI设计了这篇论文的第一个核心技术创新DeepEncoder。DeepEncoder 是一个约3.8亿参数的串联架构它的工作流很像个情报处理团队形成一个三级串联的架构。第一级是一个80M参数的SAM-base感知器。它就像个搜集情报的特工专门负责处理高分辨率输入的局部细节。当面对1024×1024的图像时它会将其分解为4096个图像块但通过窗口注意力机制将计算严格限制在小窗口内部从而在处理海量局部token时保持极低的激活内存。第二级是整个架构的关键是一个16倍压缩器(Conv 16x) 。它的角色像一个信息汇总员是一个2层的卷积模块。它接收来自第一阶段的4096份“原始情报”并通过一个可学习的16倍下采样将其“压缩提炼”成一份仅有256条视觉token的“摘要简报”。它在训练中被教会了如何保留对“解压文本”最重要的特征。第三级是一个300M参数的CLIP-large知识层它就像个总指挥官。这一部分不看那4096份原始情报他只看这份256条的摘要简报。因为简报足够短他可以奢侈地使用昂贵的全局注意力Global Attention对这256条精华信息进行全面的交叉对比和精细观察从而理解这些压缩token之间的长距离关系和全局语义结构。编码器DeepEncoder输出的256个token只是一个全局视觉摘要。真正负责按顺序复述出完整上下文的是后续的解码器 DeepSeek-3B-MoE 。DeepSeek-3B-MoE 接收到这个视觉token的摘要生成文本。它会参考DeepEncoder给出的全局摘要中的“中间部分”的视觉证据同时用自己的语言模型来确保上下文的连贯。DeepEncoder 这种先局部、再压缩、后全局的串联设计完美地规避了所有之前解决方案的问题。Vary像两个独立专家一个看细节一个看轮廓LLM最后自己去猜。DeepEncoder 则是单路串联信息逐级提炼架构更优。InternVL2则是把大图切成海量碎片产生几千个token也不具备全局性和压缩能力。DeepEncoder通过内部压缩只产生几百个token。Qwen2-VL试图对几千个token直接用全局注意力很容易导致显存爆炸。DeepEncoder 则只对压缩后的256个token用全局注意力成本可控。这种“先局部感知再压缩提炼后全局理解”的设计哲学完美解决了高分辨率处理和低计算成本之间的矛盾。实验结果证明了这一设计的有效性10倍压缩率 当使用64个视觉tokenTiny模式解码600-700个文本token时压缩率达到 10.5倍OCR精度高达 96.5%。20倍压缩率 当压缩率飙升到近 20倍时如用64token解码1200token模型精度会下降但依然保持在 ~60% 的可用水平。Deepseek OCR所需的tokens数量会随文档类型而变化简单演示文稿约需64tokens书籍和报告约需100tokens复杂的报纸内容则需启用所谓的“高达模式”Gundam Mode最高使用800tokens。在实际的OCR基准OmniDocBench上它更是实现了降维打击DeepSeek-OCRSmall模式仅用100个视觉token性能就超过了使用256个token的GOT-OCR2.0。DeepSeek-OCRGundam模式使用不到800个视觉token性能全面超越了需要近7000个token的MinerU2.0。这意味着用这种方法实际上可以做到当下上下文极限长度的十倍而不降低其准确率。而且因此其压缩效率单颗英伟达A100 GPU即可每日处理超过20万页文档若配备20台服务器每台搭载8颗A100 GPU系统的日处理能力可提升至约3300万页。DeepSeek-OCR还可识别并处理多种文档类型包括纯文本、图表、化学式与几何图形。它支持约100种语言既能保持原始版式又能输出纯文本或生成图像内容描述。更重要的是这种方法不需要任何额外的基础设施成本因为多模态系统本身就需要视觉编码器。DeepSeek-OCR实际上是在现有的VLM基础设施上实现了一种全新的文本压缩范式。03窗口注意力的回响其实DeepSeek所用的方法会多少让人有点眼熟。因为在Transformer统治一切之前在BERT和早期RNN的时代窗口是最主流的妥协方案。无论是RNN的BPTT随时间反向传播截断还是BERT为代表的模型所采用的滑动窗口Sliding Window其逻辑都是模型无法一次性处理全部上下文那就只看一个固定大小的窗口。这其实和DeepSeek-OCR有点像它也是把上下文截成一个个压缩后的图像信息去处理。但过去的方法无法处理信息孤岛效应。当注意力被严格限制在局部窗口内时模型失去了理解长距离依赖关系的能力。一个文档的标题可能无法与其对应的图表产生有效的关联因为它们被困在不同的“注意力窗口”中。这种局限性使得传统窗口方法在需要全局理解的任务中表现不佳。但在Transformer时代这个方法的内在机制已经发生了质变。它继承了窗口注意力计算高效的优点同时通过混合架构设计巧妙地解决了信息孤岛问题。这里面先验知识 (Prior Knowledge)是最关键的区别。BERT的窗口是缺乏先验知识的它对处理的内容一无所知。而DeepSeek-OCR的编码器和解码器都是经过大规模预训练的模型它们对视觉结构、文本布局、语言规律都有深刻的理解。这种丰富的先验知识使得模型即使在高度压缩的情况下也能通过“智能推理”重建出原始信息。因此DeepSeek-OCR的方案不是对窗口注意力的简单复刻而是一次彻底的范式革新。它用基于先验的感知压缩取代了基于邻近性的无知截断在保留全局视野的同时实现了比传统窗口高效得多的信息保真度。04终极愿景用光学遗忘模拟人类记忆如果说10倍的上下文压缩率是DeepSeek-OCR的里子那么它在论文第五章讨论和结论中展露的野心就是它真正的灵魂。团队提出了一个极具想象力的宏伟目标模拟人类的遗忘机制。人类的记忆系统具有天然的分层和衰减特性。刚刚发生的事件在我们的记忆中晶莹剔透几个月前的经历变得模糊不清而多年前的记忆可能几乎消失。这种遗忘不是系统的缺陷而是一种高效的信息管理机制。它确保大脑将有限的认知资源分配给最相关、最重要的信息同时通过压缩和模糊化来保留远期记忆的要点。有趣的是人类的视觉感知也表现出类似的距离衰减特性。我们对10厘米处的物体看得晶莹剔透对20米外的景象则几乎看不清。DeepSeek-OCR的多分辨率设计恰好提供了模拟这种衰减机制的技术基础。AI系统可以采用以下策略来管理其记忆对于近期的上下文比如最近几轮对话系统可以保留为高精度的文本token或者渲染成高分辨率图像用Gundam模式高token数处理确保信息的完整保真对于中期上下文比如10轮前的对话可以渲染成图像并用Base模式256token处理信息开始变得模糊但仍然可用对于远期上下文比如100轮前的对话可以进一步降低渲染分辨率用Tiny模式64token处理信息高度压缩但仍保留核心要点。在实际应用中把过去的上下文作为模糊记忆利用OCR去使用的流程会更像这样模型完成今天的对话后将“昨天的对话”渲染成一张或几张图片。模型将这张历史图片喂给 DeepEncoder。DeepEncoder 对其进行全局感知和压缩最后输出一套极少数的视觉上下文token比如用Base模式输出256token。当您今天输入新的问题时比如有50个token模型会在内部将您今天的token50个和那256个代表昨天的视觉token拼接在一起。模型的解码器如 DeepSeek-3B-MoE现在只需要处理 $50 256 306token它会对这两组token一组是文本一组是视觉同时进行注意力计算然后生成对您今天问题的回答。这种分层记忆机制的最大价值在于它提供了一条通往“理论上无限上下文”的可能路径。传统的长上下文技术要么通过滑动窗口彻底丢弃历史信息要么试图保留所有细节而导致计算成本爆炸。而“光学遗忘”机制通过渐进式的信息压缩在保留历史要点和控制计算成本之间实现了动态平衡。然而这个优雅的机制是否完美它目前还不是。DeepSeek-OCR当前所展示的压缩是一种无选择性的均匀压缩。它就像我们调整图像分辨率图像上的所有内容都会被同等程度地模糊掉。这显然不符合人类的记忆机制。我们人类的遗忘是有选择性的它与注意力和重要性高度相关。我们会牢牢记住婚礼上的誓言却会迅速忘记早餐吃了什么。DeepSeek-OCR目前还做不到这一点。它用Tiny模式压缩的1天前的对话很可能把关键信息和垃圾信息一起忘掉了。但这个范式指明了下一座要攀登的高峰。DeepSeek-OCR只是第一步它验证了光学压缩这个机制的可行性。第二步就是让压缩变得有选择性。它为AI的记忆、遗忘和输入机制提供了一个全新的技术框架。有时候忘记和压缩比记住和保留更加重要。这篇文章更重要的范式意义可能是输入上统一的可能因为图像这个模态其实更合乎人类认知。当我们人类阅读时我们并不是在处理抽象的文本token而是在用视觉系统处理屏幕或纸张上的像素、形状和布局。我们的大脑首先是一个强大的视觉处理器然后才是语言解码器。因此Karpathy提出了那个激进的设想所有给LLM的输入都应该先被渲染成图像。并非毫无道理因为这可能才是更自然、更高效的信息流。这也许才是一条真正模拟了人类认知和遗忘的、通向无限上下文的AGI记忆和输入系统的新路径。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表