Your current location:Home > Latest news text

迅雷

DeepSeek又发新模型,小而美玩出新高度_我的网站

初恋日记

A |     

每经记者 许立波 每经编辑 魏官红2022年上半年,国内生物医药行业投融资趋势整体放缓。据医药魔方InvestGO数据库统计,上半年一级市场投融资事件数同比降低46.7%,环比降低45.9%;IPO事件数同比降低45.5%,环比降低55.2%;二级市场再融资事件数,同比减少57.8%,环比减少29.6%。在这一背景下,不少创新药企业艰难求生,“活下去”成为了口头禅。    就在刚刚,DeepSeek开源了一个3B模型DeepSeek-OCR。华安证券方面从A股中抽取了42家创新药公司的中报数据作为样本进行评析。结果显示,2022上半年,国内创新药板块营业总收入为1005.7亿元,同比微增2.36%,总研发费用则同比增长13.79%。虽然体量不大,但模型思路创新的力度着实不小。                   众所周知,当前所有LLM处理长文本时都面临一个绕不开的困境:计算复杂度是平方级增长的。《每日经济新闻》记者注意到,如果将创新药公司分为成熟药企和刚开始盈利或未盈利的Biotech两部分,在Biotech板块中,今年上半年营业收入最高的是百济神州(42.1亿元),收入增速最高的则是荣昌生物(1033%),收入中位数为2.29亿元,收入增速中位数为0。

B | 序列越长,算力烧得越狠。                             于是,DeepSeek团队想到了一个好办法。研发投入最高的Biotech同样是百济神州(50.16亿元),研发增速最高为125%,研发增速中位数为21%。成熟创新药企增长则相对稳定,今年上半年,复星医药总营收最高(213.4亿元),收入增速最高的为特宝生物(52.3%),营业收入中位数为50.84亿元,营收增速中位数为5.9%。既然一张图能包含大量文字信息,而且用的Token还少,那不如直接把文本转成图像?这就是所谓的“光学压缩”——用视觉模态来给文本信息“瘦身”。绕不开的PD-1 已有公司率先突围在国内创新药行业,PD-1/PD-L1是一个绕不开的话题。                   而OCR正好天然适合验证这个思路,因为它本身就是在做“视觉→文本”的转换,而且效果还能量化评估。根据IQVIA近期发布的报告,全球研究PD-1/PD-L1抑制剂的临床试验已突破5600项。

C | 过去5年,PD-1/PD-L1检查点抑制剂是最具活力的细分市场之一,其表现明显优于全球抗肿瘤药市场,5年复合增长率为45%,是抗肿瘤药整体增长率的3倍,按厂商出厂价计算,2021年全球市场规模达360亿美元(约人民币2500亿元)。随着PD-1/PD-L1市场的成熟,未来增长预计将放缓至15%(5年复合增长率)。                             论文显示,DeepSeek-OCR的压缩率能达到10倍,OCR准确率还能保持在97%以上。                   啥意思呢?就是说,原本需要1000个文本Token才能表达的内容,现在只用100个视觉Token就搞定了。IQVIA预测,到2025年,这一领域的全球销售额将达到580亿美元(约合4000亿元人民币)。在国内市场,目前已有十四款PD-1/PD-L1单抗获批,分别涉及恒瑞医药、百济神州、君实生物、信达生物、康方生物、誉衡药业、复宏汉霖、康宁杰瑞、基石药业、乐普生物等上市企业。

D | 以PD-1四小龙(恒瑞医药、百济神州、君实生物、信达生物)为例,Wind数据显示,2022年上半年,四家企业合计实现营业收入176.24亿元,较去年同期222.45亿元的合计营收减少20.77%;合计实现归母净利润-64.07亿元,相比去年同期净亏损有所扩大;四家企业的研发支出则合计达到94.37亿元。

E | 具体来看,恒瑞医药上半年营收为102.28亿元,同比下降23.08%;归母净利润为21.19亿元,同比下滑20.55%。面对罕见的营收利润双降,公司在半年报中解释称,其业绩下滑主要受集采、医保谈判和部分地区疫情反复等多重因素影响。传统仿制药受到冲击,创新药放量不及预期,或是恒瑞医药交出“史上最差”半年报成绩单的主要原因。实际上,市场对于恒瑞医药的业绩增长失速也早有预期。即使压缩率拉到20倍,准确率也还有60%左右,整体效果相当能打。

F |                    OmniDocBench基准测试结果显示:                    只用100个视觉Token,就超过了GOT-OCR2.0(每页256个Token)的表现;          用不到800个视觉Token,干翻了MinerU2.0(平均每页超过6000个Token)。财报显示,从2021年第二季度到2022年第二季度,恒瑞医药已面临业绩承压的挑战,上述期间,恒瑞医药的单季度归母净利润同比下滑幅度分别为13.03%、3.57%、84.39%、17.35%以及24.65%。                        在实际生产中,一块A100-40G显卡就能每天生成超过20万页的LLM/VLM训练数据。20个节点(160块A100)直接飙到每天3300万页。恒瑞医药的营收则是从2021年第三季度开始出现同比下滑,公司营收单季度同比下滑幅度分别为14.84%、31.42%、20.93%及25.42%。                             DeepSeek-OCR由两个核心组件组成:                    DeepEncoder(编码器):负责图像特征提取和压缩;          DeepSeek3B-MoE(解码器):负责从压缩后的视觉Token中重建文本。在PD-1产品上已有5项适应症被纳入国家医保目录的百济神州则是四家企业中业绩相对亮眼的一个。                        让我们来重点说说DeepEncoder这个引擎。

G | 今年上半年,百济神州的两款自研产品PD-1抗体药物百泽安(替雷利珠单抗注射液)和BTK抑制剂百悦泽(泽布替尼胶囊)的吸金能力较上年同期显著提升,共实现产品收入36.76亿元,较上年同期上升132.2%。                   它的架构很巧妙,通过把SAM-base(8000万参数)和CLIP-large(3亿参数)串联起来,前者负责“窗口注意力”提取视觉特征,后者负责“全局注意力”理解整体信息。                   中间还加了个16×卷积压缩器,在进入全局注意力层之前把Token数量大幅砍掉。                   举例而言,一张1024×1024的图像,会被切成4096个patch token。其中,替雷利珠单抗在中国市场的销售额为12.51亿元,相比较于上年同期的8亿元增长近56.37%。

H | 医保报销范围扩大带来的新增患者需求持续推动替雷利珠单抗在已获批适应症的市场渗透率和市场份额的扩大。但经过压缩器处理后,进入全局注意力层的Token数量会大幅减少。                   这样的好处是,既保证了处理高分辨率输入的能力,又控制住了激活内存的开销。

I | 另外,根据8月26日信达生物发布的2022财年中报数据,公司报告期内营业收入同比增长15.34%。而在PD-1产品信迪利单抗的销售业绩上,根据礼来方面的披露,2022年上半年信迪利单抗在中国市场的收入合计为1.59亿美元,较上年同期的2.15亿美元下降近三成,信迪利单抗已在与替雷利珠单抗的交锋中稍逊一筹。信达生物在半年报中称,尽管信迪利单抗因纳入最新国家医保目录价格降幅明显,但产品销量快速增长且新产品的收入贡献日益增加仍然驱动产品收入的整体增长。                   而且DeepEncoder还支持多分辨率输入,从512×512的Tiny模式(64个Token)到1280×1280的Large模式(400个Token),一个模型全搞定。然而,由于中国部分地区新冠疫情反复等情况,对产品收入的增长率有所影响。作为国产首款获批的PD-1,君实生物的特瑞普利单抗却在与其余三家PD-1的竞争中被拉开了显著差距。2021年年报显示,PD-1特瑞普利单抗去年营业收入共计4.12亿元,同比下降58.96%,较2020年的10.03亿元减少了近6亿元,这也是特瑞普利单抗自2018年底获批以来年销售额最低的一年。                   目前开源版本支持的模式包括原生分辨率的Tiny、Small、Base、Large四档,还有动态分辨率的Gundam模式,灵活性拉满。横向对比看,在国产PD-1“四小龙”中,君实生物特瑞普利单抗的销售收入也处于垫底位置。                             解码器用的是DeepSeek-3B-MoE架构。                   别看只有3B参数,但采用了MoE(混合专家)设计——64个专家中激活6个,再加2个共享专家,实际激活参数约5.7亿。这也让模型既有30亿参数模型的表达能力,又保持了5亿参数模型的推理效率。8月30日,君实生物披露了2022年上半年业绩报告,报告期内实现收入9.46亿元,同比下降55.26%,这是因为去年新冠中和抗体埃特司韦单抗与礼来制药合作,产生大额技术许可收入及特许权收入,而今年没有相关的一次性收益。君实生物归母净利润由盈转亏,从去年同期的盈利934.7万元转为大幅亏损9.12亿元。                   解码器的任务就是从压缩后的视觉Token中重建出原始文本,这个过程可以通过OCR风格的训练被紧凑型语言模型有效学习。

J |                    数据方面,DeepSeek团队也是下了血本。

K | 此外,其PD-1抗体特瑞普利单抗上半年销售收入为2.98亿元,其中2022年第一季度较2021年第四季度环比提升212%,即使受到4月、5月部分地区疫情影响,其第二季度销售较第一季度环比提升70%。                   从互联网收集了3000万页多语言PDF数据,涵盖约100种语言,其中中英文占2500万页。                   数据分两类:粗标注直接用fitz从PDF提取,主要训练少数语言的识别能力;精标注用PP-DocLayout、MinerU、GOT-OCR2.0等模型生成,包含检测与识别交织的高质量数据。                   对于少数语言,团队还搞了个“模型飞轮”机制——先用有跨语言泛化能力的版面分析模型做检测,再用fitz生成的数据训练GOT-OCR2.0,然后用训练好的模型反过来标注更多数据,循环往复最终生成了60万条样本。从销售数据上可以看到,自去年11月公司任命李聪为公司联席首席执行官,全面负责商业化领域相关工作以来,特瑞普利单抗在国内市场的销售活动逐步走出低谷。                   此外还有300万条Word文档数据,主要提升公式识别和HTML表格解析能力。不过,考虑到目前与其余三家PD-1产品在销量上的差距,特瑞普利单抗未来能否实现销售放量依然有待市场检验。

L | 另外获批的四款国产PD-1中,来自康方生物的派安普利单抗,今年上半年销售业绩近2.97亿元,与君实生物已相差无几;复宏汉霖的斯鲁利单抗在上市三个月中就卖了7690万元,誉衡药业的赛帕利单抗暂未披露相关数据,乐普生物的普特利单抗由于今年7月才获得批准,上半年并未产生销售收入。                   场景OCR方面,从LAION和Wukong数据集收集图像,用PaddleOCR标注,中英文各1000万条样本。

M | 创新药进入下半场 企业如何度过寒冬?面对业绩困境,恒瑞医药也不得不断臂求生。公司销售费用也在下降,今年上半年公司销售费用为32.67亿元,同比下降近三成。尽管处于由“仿”入“创”的阵痛期,恒瑞医药仍坚定加大研发投入。

N |                              DeepSeek-OCR不仅能识别文字,还具备“深度解析”能力,只需一个统一的提示词,就能对各种复杂图像进行结构化提取:                    图表:金融研究报告中的图表可以直接提取为结构化数据;          化学结构式:识别并转换为SMILES格式;          几何图形:对平面几何图形进行复制和结构化解析;          自然图像:生成密集描述(dense captions)。报告期内,公司累计研发投入达到29.09亿元,同比增加12.74%,研发投入占销售收入的比重同比提升至28.44%,其中费用化研发投入21.84亿元,研发费用占销售收入比重同比提升至21.36%。

o |                         这在STEM领域的应用潜力巨大,尤其是化学、物理、数学等需要处理大量符号和图形的场景。

p | 在研发上投入最多的还要属百济神州,其上半年的研发费用高达50.16亿元,同比增加20.82%,在国内创新药企业中一骑绝尘。百济神州表示,之所以研发费用高,是因为在全球范围内,公司正在为超过40种药物和候选药物执行近80项正在进行或已计划的临床试验。                   第一作者Haoran Wei此前曾供职于阶跃星辰,期间发布并开源了GOT-OCR2.0系统                    值得注意的是,DeepSeek团队在论文里还提出了一个脑洞大开的想法——用光学压缩模拟人类的遗忘机制。

q | 也正是由于真金白银砸出来的研发能力,今年上半年,替雷利珠单抗在国内新增获批3项适应症,由此共计9项适应症取得批准,成为国内市场上获批治疗适应症最多的抗PD-1单抗。                   人类的记忆会随时间衰退,越久远的事情记得越模糊。对于PD-1市场的竞争,不少业内观点认为“得适应症者得天下”,替雷利珠单抗未来销量有望进一步放量。DeepSeek团队想,那能不能让AI也这样?于是,他们的方案是:                    1. 把超过第k轮的历史对话内容渲染成图像;          2. 初步压缩,实现约10倍的Token减少;          3. 对于更久远的上下文,继续缩小图像尺寸;          4. 随着图像越来越小,内容也越来越模糊,最终达到“文本遗忘”的效果。

r |                    这就很像人类记忆的衰退曲线,近期信息保持高保真度,久远记忆自然淡化。                   虽然这还是个早期研究方向,但如果真能实现,对于处理超长上下文将是个巨大突破——近期上下文保持高分辨率,历史上下文占用更少计算资源,理论上可以支撑“无限上下文”。信达生物中报显示,公司上半年研发开支达11.74亿元,同比增加20.54%,公司称,“稳定上升的研发开支,主要用于公司全球在研管线中处于开发后期阶段的产品及优先开发产品的临床试验,以进一步扩大公司现有产品系列的适应症,以及开发公司在研新药,包括临床前的项目开发。                             简言之,DeepSeek-OCR表面上是个OCR模型,但实际上是在探索一个更宏大的命题:能否用视觉模态作为LLM文本信息处理的高效压缩媒介?                    初步答案是肯定的,7—20倍的Token压缩能力已经展现出来了。                   当然,团队也承认这只是个开始。”管线进展方面,报告期内信达生物已建立起34条管线。

s | 单纯的OCR还不足以完全验证“上下文光学压缩”,后续还计划开展数字–光学文本交替预训练、“大海捞针”式测试,以及其他系统性评估。                   不过不管怎么说,这在VLM和LLM的进化路上,又多了一条新赛道。                   去年这个时候,大家还在卷怎么让模型“记得更多”。今年DeepSeek直接反其道行之,不如让模型学会“忘掉一些”。                   确然,AI的进化,有时候不是做加法,而是做减法。小而美,也能玩出大花样,DeepSeek-OCR这个3B小模型就是最好的证明。

t | 值得一提的是,上半年公司有7个产品获得批准上市,3个品种在NMPA审评中,4个品种进入III期或关键性临床研究,另有20个产品已进入临床研究。君实生物同样在持续扩大研发规模,其上半年研发投入共计10.62亿元,同比增长12.14%。截至6月末,君实生物处于商业化阶段的在研产品3项,近30项在研产品处于临床试验阶段,超过20项在研产品处在临床前开发阶段。                   GitHub主页:http://github.com/deepseek-ai/DeepSeek-OCR          论文地址:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek\_OCR\_paper.pdf          模型下载:https://huggingface.co/deepseek-ai/DeepSeek-OCR                    本文来自微信公众号:APPSO (ID:appsolution)。但与此同时,君实生物目前较弱的造血能力也使其更为依赖外部融资,今年3月,君实生物发布定增募资预案,由于融资数额逼近40亿元,该募资计划一经发布便引发市场关注。在定增募资预案发布半年后,君实生物于9月2日发布定增方案的申报稿。申报稿显示,君实生物此次发行股票数量不超7000万股,募集资金总额(含发行费用)不超39.69亿元。

u | 其中,36.71亿元拟用于创新药研发项目,2.98亿元拟用于上海君实生物科技总部及研发基地项目。对此,有投资人质疑,在“创新药寒冬”背景下,其他创新药公司都在收缩管线、控费增效,君实生物这笔涉及近40亿元的定增计划被认为是“逆势”启动。不过,君实生物董秘陈英格此前在接受记者采访时表示,“逆势”不一定是一个贬义词,相反对于Biotech公司而言,顺势扩张反而往往会导致泡沫堆积、增加风险。“但如果别人都在因为一些迫不得已的原因而收缩,我们的手上这时候如果能再多一些‘子弹’,让公司在竞争中获得优势并且拉开差距,对于企业的中长期发展会有非常大的助力。

Current article:http://1gge54.cengzaodengchawonin.cyou/ccjh/rsm.html

Published on:01:15:07


Related reading
Copyright © 2020-2099 迅雷 All Rights Reserved 迅雷 Copyright