🔥热词:模型

9月16日,B站「AI无限竞技场」正式上线,首期大模型测评榜单同步公布。GPT-6 Astra在10个UP主测评中拿下榜首,打败GLM-5.3获得榜首次数冠军;前五名中,国产大模型占据三席。 「AI无限竞技场」是一个汇集了B站UP主AI大模型测评的竞技广场,由各领域UP主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同于传统跑分评测,B站AI无限竞技场不设主题或测评维度限制,来自各个分区的UP主们以真实工作流、专业应用、趣味脑洞等自主命题,在同题PK中直观呈现各模型的实际表现差异。首期榜单现已涵盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax…等主流模型对比测评。 过去一年,B站AI生态迎来爆发式增长。AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。AI大模型或产品应用,从发布到用户讨论、测评、使用、求助、共建,B站的直播、视频、弹幕天然适配AI科技爱好者们的信息获取和交流需求,活跃生态下,大模型测评也在B站社区沉淀,涌现出大量各个领域、维度、主题的测评内容。「AI无限竞技场」这一测评集合广场顺势而生。 竞技场排名将会实时更新,并持续面向全站UP主开放报名。 随着更多测评案例加入,这些来自真实场景的样本测试,将让模型能力得到更充分检验,也为用户了解AI能力边界提供更全面的内容视角。 榜单链接:https://www.bilibili.com/blackboard/era/aiarena.html?bsource=market_aiarena_sns_02
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0 今天,智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(模型简称 HD-V1)。HD-V1采用智象自研原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出5–20秒1080p高保真视频,同时 在意图理解、物理规律理解、自主规划叙事、以及音画一体化生成等维度均全面升级,达到全球领先水平。 发布同期,HD-V1 在两项国际权威评测榜单中,均位居世界前列。在全球领先的独立 AI 基准测试与分析平台Artificial Analysis Image to Video Leaderboard(With Audio)排行榜上,HD-V1 取得全球排名第四的佳绩。Artificial Analysis 的图生视频榜单以标准化、可复现的基准对全球头部视频生成模型进行系统评测,被视为衡量AI视频模型综合实力的重要标尺。 在全球最具影响力的AI 模型盲测评测平台 Arena.ai Image-to-Video 中,HD-V1也取得了第8的优异成绩。Arena.ai Image-to-Video是专注于AI视频生成模型的盲测评测子平台,是目前评估图生视频模型能力的重要第三方参考,被全球国际主流 AI 厂商广泛引用。 放在全球 AI 竞争格局中看,这一成绩的意义远超名次本身:多模态是当下全球人工智能的核心战场,图生视频则是其中技术密度最高、竞争最激烈的方向之一。HD-V1 以双榜高位成绩完成全球首次亮相,这标志着中国优秀大模型企业已全面领先,形成全球AI视频模型第一梯队 。 智象未来 CTO 姚霆表示:“HiDream-O1-Video-1.0 是智象原生全模态世界模型矩阵的关键组成部分。我们始终相信,视频生成的代际进化不仅仅是像素的提升和时长的延续,而在于模型是否真正理解创作者的意图和真实世界的物理规律。HD-V1从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’。这次在两项国际权威榜单中再次进入第一梯队,是对智象原生全模态技术路线最直接的验证。” 01.原生全模态,更懂意图、更懂物理 视频生成的难点,往往不在“会不会画”,而在“有没有听懂”。用户输入常常是口语化、碎片化、模糊化的信息。直接输入丢给模型,很容易出现意图漏解、镜头跳戏、人物漂移与音画错位等问题。 为此,HD-V1的设计中 前置多模态意图理解模块,借助多模态理解模型的深度理解与思考,对视频内容进行结构化规划。规划内容包括镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段、台词与背景声等音效设计等等字段。该模块的存在,保证模型充分理解用户自然语言输入的意图,并转换成模型可接受的专业表达。理解越深,规划越稳;规划越稳,后续联合生成越不容易“跑偏”。 理解意图只是第一步,HD-V1的另一重要突破,是“更懂物理”。 物体在重力作用下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续——这些物理规律既被理解,也被写进视频模型的叙事之中,成为画面生成的底层逻辑。 当物理规律进入生成逻辑,画面的真实质感得到全面提升。以下三组demo,是在同样的提示词下,三款业内顶级模型生成的视频对比,第三个demo为HD-V1生成(全文均同)。 模型一的画面中,双手相向发力,红线产生了向内缩短的“不合理”现象;模型二则突兀地凭空生出一根针。而HD-V1生成的画面截然不同:双手相向发力时,红线自然隆起,与模型一形成鲜明对比;当左手拇指向外轻捻线头,红线便随手的发力顺势延展,张力、走向与形变皆贴合真实物理。而且画面还有着极佳的真实质感,指甲的纹理,针的金属感等都表现得非常真实,甚至从中能感受到线的柔韧。 02.画面高保真、叙事连贯性、人物一致性全面升级 针对高保真画质、叙事连贯性与人物一致性等关键指标,HD-V1实现了全面优化升级。它不只追求单帧画面的精美,更要让视频内容在整体叙事维度上自洽。 当人物、情绪、动机、物理规律,一旦进入连续镜头,就必然互相影响。为此,智象提出了 “先规划、后联合生成、再以多模态 Reward 对齐”的技术思路 ,让模型先在全局层面规划叙事与角色状态,再在联合生成中约束画面、动作和语义,最后用多模态奖励信号对齐画质、连贯性与物理合理性。 03.服从叙事内容视频生成时长的逻辑革新 多数视频生成时长遵循的是固定提示词路线,比如用户在提示词中输入生成 5 秒,模型只能在这个时间窗口内填充内容,内容叙事“被迫”适应时长。 HD-V1的做法,是 把时长决策交还给内容本身 。模型根据事件展开的逻辑、动作完成的周期、叙事推进的节奏,自行规划生成时长。这一能力的关键,不在于简单改变帧数,而在于把时长选择与内容情境绑定,服务用户真正的目标——在连贯叙事中交付合理、真实质感的完整画面。 同样是三款模型的真实对比。前两款模型都“机械地”生成了10秒钟画面,但一颗苹果从抛出到接住,本是一个短促的过程,并不需要撑满10秒。于是,模型一在动作完成后,从第三秒起只能让手继续握着苹果,画面停留在无意义的等待里;模型二则用慢放的形式,来填补时长。而HD-V1生成的画面,人物抛出、接住、稳定手持,节奏自然发生。 04.文本、视频、音频信号联合建模音画原生一体化生成 音画不同步是AI视频生成模型的一个普遍通病。这是因为当前多数视频模型采用的后期拼接技术路线:先逐帧生成画面,再回头配音配效,声音跟画面很难保持一致。 HD-V1 采用了原生全模态架构,对文本、视频、音频信号进行联合建模 。三者在同一生成过程中相互约束、相互对齐:画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。这种联合建模,直接服务于音画同步与叙事连贯。镜头切换时,环境声与配乐随之过渡;人物开口时,口型、气口与情绪同频;物理动作发生时,拟音效果与撞击反馈更贴近真实因果。 这是一个乒乓球在桌子上弹跳的画面。从三款模型生成的画面来看,只有HD-V1生成的内容,不仅乒乓球掉落的节奏符合物理规律,每次掉落的声音也随着高度的变化而变化,完全符合现实质感。实现真实世界的质感,根源在于模型的技术产品哲学:以人的感受为尺度。为此在后训练阶段,采用 Diffusion Reinforcement Learning,并设计与人工认知对齐的多模态 Reward 模型,对音视频内容进行从画面到声音、从局部到整体的统一评估。 05.世界模型闭环成型从单点能力到原生全模态矩阵 从今年4月正式发布原生全模态世界模型架构HiDream-O1以来,智象陆续发布了基于同一架构的模型家族,这几款模型也分别在各自赛道上取得国际权威榜单的领先位置。 图像生成模型HiDream‑O1‑Image系列 ,其中商用版1.5 版本在国际独立评测平台 Artificial Analysis 文生图榜单中,取得中国第一、全球第二的成绩;开源版本也取得了第二的成绩。 交互式世界模型 HiDream‑O1‑World ,名列行业首个交互式世界模型基准 WBench综合总榜第一。 具身世界模型 HiDream‑O1‑Embodied ,先后在 RoboColiseum的扰动适应和空间推理子榜单中登顶榜首。 随着视频模型正式发布,业内首个原生全模态世界模型闭环就此成型。图像、视频、3D交互与具身动作,在统一原生的世界模型中交汇、共生、循环。 智象创始人梅涛博士表示:“基于我们对下一代人工智能技术路线的认知,智象致力于构建 ‘一个原生全模态底座、四大模型同源演进’的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化走向可落地的原生全模态体系。” 06.C+轮融资落定,国资产业资本组团再加码 在HD-V1发布之际,智象同时宣布完成C+轮融资。本轮投资方为 新微资本、交子资本、工银资本 ,体现了资本市场对公司原生全模态技术路线、世界模型布局及产业化潜力的高度认可。 新微资本由上海新微科技集团、上海科创投集团以及管理团队共同发起成立,管理基金规模近百亿元。作为新微集团的CVC,新微资本正持续加强在人工智能赛道的布局,依托新微集团在集成电路特色工艺制造领域的产业基座,构建在AI时代具备持续竞争力的新微产业生态。 新微资本表示:“智象未来的原生全模态世界模型矩阵,向上连接算力与AI基础设施,向下延伸至智能终端与行业应用,与新微集团的产业布局高度协同。未来新微将以制造能力支撑算力基建,以产业资源加速模型落地,助力智象未来占据世界模型时代的关键席位。” 交子资本是成都交子金控集团旗下全资国有股权投资平台,也是成都建设西部金融中心的重要产业资本载体,管理基金规模超1700亿元。依托成都、辐射西部、链接全国,交子资本聚焦人工智能等硬科技赛道,以长期资本和产业资源推动科技成果转化与产业生态建设。 交子资本相关负责人表示:“智象未来持续推动图像、视频、3D交互与具身四大模型同源演进,围绕底层架构持续创新,构建原生全模态世界模型矩阵。这一路线在行业中具有鲜明的稀缺性和领先性。HiDream-O1-Video-1.0的发布补齐了模型矩阵的关键一环,进一步验证了公司技术路线的前瞻性与落地能力。我们期待发挥国有产业资本的长期陪伴与资源协同作用,助力智象未来成长为具有全球竞争力的AI企业,并带动成都、辐射西部人工智能产业生态建设。” 随着HD-V1视频模型的发布,从原生全模态通往世界模型,不再只是一张战略蓝图,而是闭环发展、持续演进的现实。
9月15日,阶跃发布新一代语音大模型 StepAudio 3 系列,一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。其中,多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。 相比过去主要围绕语音识别或语音生成等单项能力展开竞争,StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力,让 AI 不仅能够“听”和“说”,也能够理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。 其中,面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话,可以在持续交流过程中判断何时回应、何时等待,并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中,该模型以 98.9% 的综合得分排名全球第一。 与传统实时语音模型主要追求低延迟和自然对话不同,StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行;Tool Call 和长任务则可以异步执行,在任务运行期间不打断当前对话。其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。 在语音识别方面,StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合,不仅要解决“听清楚”,也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。 该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中,StepAudio 3 ASR 的 WER(词错误率)为 1.7%,并列全球第一。WER 越低意味着转写错误越少,该成绩意味着模型在第三方综合测试中的语音识别准确率已处于全球第一梯队。 除实时交互和语音识别外,此次发布也进一步拓展了语音生成模型的能力边界。 StepAudio 3 TTS 面向真人级语音生成,在音色、语调、节奏、停顿和情绪表达之外,还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用需求。 StepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并控制角色音色、情绪以及不同声音出现的时间与顺序,广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。 面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”,而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代,使 AI 更深入参与实际音乐生产流程。 过去一年,语音大模型正从单项的语音识别和生成能力,逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布,阶跃音频模型的产品版图,已经全面覆盖了听、说、理解、推理和创作。 目前,StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。
近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。 Puffin-World同步开源代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。 针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。 统一构建三种原生状态——物理、几何与外观 Puffin-World从三维世界状态本身出发,将其建模为三种相互关联的原生状态: 三种状态共同构成从“世界如何存在”到“世界如何被交互”的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。 为统一绝对方向和跨视角运动,Puffin-World提出Omni-Camera相机表示,将重力锚定的绝对相机信息与基于射线的相对几何结合起来。模型先从参考图像中精确理解相机的横滚角、俯仰角和视场角,再通过物理传播机制,将参考视角中的重力信息传递至后续视角。 即使相机经历连续旋转和长轨迹移动,整个生成过程也拥有一个稳定的物理参照系。地平线不会随意漂移,场景的上下关系不会在运动中失真,生成视角与目标相机轨迹也能保持一致。 Puffin-World还在同一次生成过程中联合输出RGB外观和深度几何,使生成结果能够直接用于三维重建,而不必在视频生成之后再依赖独立的深度估计模块补充空间结构。由此,世界生成与世界重建不再是前后割裂的两个步骤,而成为同一个状态预测过程。 一个模型完成四件事,从理解世界走向闭环探索 Puffin-World可以在一个模型中统一四类过去往往需要不同系统分别完成的任务。 第一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别“图中有什么”,还理解“当前视角以怎样的姿态看到了它”。 第二,自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。 第三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。 第四,闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演World Action Model (WAM)角色。技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。 这四类能力并非四个模型的简单拼接,而是由同一套视觉、语言、相机和世界状态表征共同支撑。任务的变化不再依赖切换系统,而由输入内容、相机条件和视图角色决定。这种统一性,使Puffin-World更接近机器人从感知、推理到行动的完整工作链路。 1600万核心数据与4450万开放标注,扩大世界模型训练底座 世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。为此,团队构建了Puffin-16M数据集,包含两个组成部分。 Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。 Puffin-Traj-1M则提供100万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况,重点补足传统三维数据集在大幅旋转和长轨迹探索方面的不足。 与主要描述视角之间相对变化的数据不同,Puffin-16M进一步引入相机相对于重力和真实世界的绝对方向。模型不仅学习“相机从上一帧移动了多少”,还要理解“相机当前在世界中处于什么方向”。 除自建数据集外,团队还利用Puffin-World精准的物理世界感知能力为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图片,包括ImageNet、CC12M、Objects365、ScanNet、DL3DV和GPIC等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。 更重要的是,Puffin-World同步开放代码、模型和数据集。开源的不只是一个算法实现,而是一套从数据、标注、训练到评测的完整技术链路,使研究机构和产业开发者可以围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能开展后续开发。 四项SOTA,从相机理解到三维生成 Puffin-World的统一能力在四项Benchmark中取得SOTA成绩。 在相机到真实世界理解任务上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差,并在大多数AUC指标上领先。 其中,在Stanford2D3D上,Puffin-World对横滚角、俯仰角和垂直视场角的中位误差分别为0.29度、0.53度和1.62度,显示出较强的绝对相机理解能力。 在相机可控生成基准Puffin-Cam-Bench上,模型生成结果的上方向、纬度和重力方向中位误差分别为0.84度、1.26度和0.79度,FID为75.93,均优于参与比较的通用图像生成模型和已有相机可控生成方法。这意味着Puffin-World不仅能够生成质量较高的图像,还能让生成画面准确服从指定的相机状态。 在Puffin-Traj-Bench上,Puffin-World取得18.00的PSNR、0.613的SSIM和0.288的LPIPS;生成轨迹的横滚角、俯仰角和视场角中位误差分别为0.80度、1.10度和2.96度。其中,PSNR、LPIPS以及三项相机控制误差均取得最优结果。 在RealEstate10K三维世界生成测试中,Puffin-World取得17.22的PSNR、0.595的SSIM和0.318的LPIPS,三项视觉一致性指标均优于对比方法。 这些结果表明,Puffin-World并非只在单一任务上提高图像质量,而是在相机物理理解、灵活空间控制、几何一致性生成和三维重建之间建立了相互支撑的统一能力。 从“生成一段看起来合理的视频”,到“预测一个具有物理、几何和外观一致性的世界状态”,Puffin-World推动世界模型从视觉内容生成进一步走向可感知、可校准、可探索和可重建的三维环境。这也是世界模型真正进入机器人训练与具身智能应用所需要完成的一次范式转变。
做3D国漫角色时,第一张立绘惊艳全场,第二个分镜却让团队沉默——角色漂移、产能崩盘。问题不在提示词长度,而在方向:三视图只能展示,无法锚定。本文提出DNA锚定系统与DZS角色资产生成框架,从底层原理到工程落地,帮你彻底解决跨镜头一致性难题。
当所有人都在卷大模型对话时,OpenAI 老兵却反其道而行,做出了一个「不说话」的模型 JEV。它不生成文本,只输出类型化的决策和概率,上线首日 API 就被挤爆。本文从创始人背景、核心原理到与 LLM 的本质区别,用大白话讲透这个「机器原生智能」新物种,以及它为何可能成为 Agent 时代的「快判断层」。
每次有人问我 AI 到底怎么落地,我都会先反问一句:你想要的“落地”,到底是 PPT 上画一画,还是真的让它坐在流程里天天干活?文章把 AI 部署拆成五个连接,任何一个没接上,都是失败的一种现成姿势。
“大家好,我是阿境,人称产品界的吴彦祖,一个沉稳又不沉闷的男人。” 先问个问题 “作为一名产品经理,你真的懂得沟通吗?” 诶,先别急着回答,看完文章,再重新思考下这个问题。 产品经理在日常工作当中, 不夸张地说,沟通几乎是占据了40%的工作内容 ,与运营沟通,与开发沟通,与用户沟通,与领导沟通等。 学会如何更高效率地沟通,能够使事情事半功倍,也能够有效地推动产品项目的运转。 同时,我
Pew Research Center 对美国用户在 Google 上大规模浏览行为的分析发现:有 AI 摘要时,用户点击传统搜索结果的比例从 15%直接暴跌至 8%。[1]
上下文窗口不是越大就越值钱。面试官那句"除了换长窗口还想过别的办法吗",问的其实不是窗口大小,而是你有没有把记忆管理当成一个独立的工程问题来对待。能不能判断"什么该记住、什么该压缩、什么可以彻底忘掉",这才是衡量一个 Agent 是不是真正好用的分水岭。
技术选型的第一原则,不是"我能不能用这个技术",而是"这个问题需要什么技术"。
Jev 不神秘。它的很多技术零件以前就有:分类、约束输出、logits 打分、概率校准、判别式路线。但它把这些东西组合成了一个清晰的开发者接口。
开源的Laya冒了出来。它有421M参数,大约是4.2亿,采用Apache 2.0协议。Laya自称单问题延迟低了近8倍。在它自己公布的typed-decisions测试集上,专用微调checkpoint的准确率达到0.766,高于其中对比的Jev 1.13.0的0.727。