lol(全文在线阅读)>
lolZPedia|Qwen 3.8 Max Preview实测:逼近顶级闭源上限,长任务稳定性略输K3_我的网站
一 | (文/观察者网 刘媛媛 编辑/吕栋) 7月17日,以“智能伙伴,共创未来”为主题的2026世界人工智能大会(WAIC)在上海开幕,海光信息携CPU、DCU全系列产品以及网络互联、整机解决方案亮相,展示了面向AI时代的自主算力底座与全链路软硬一体化能力。 7 月 19 日,Qwen 团队毫无预热地抛出了一枚重磅炸弹:Qwen 3.8 即将发布,并将开放权重。 按照官方披露的信息,这一代模型的总参数规模达到 2.4 万亿。更引人注目的是 Qwen 对它的定位:与一线闭源旗舰正面竞争,并声称其能力「仅次于 Fable 5」。 观察者网在现场了解到,展区内,海光CPU系列面向服务器、数据中心等通用计算场景提供算力支撑;DCU系列作为高端AI加速芯片,支持全精度浮点及多类型整数计算,兼容主流软件生态,支持训练与推理;端侧嵌入式产品,如运动控制系统、AI一体机、云终端等,则推动AI从“能对话”向“能干活”演进。与此同时,Qwen3.8-Max-Preview 已经先一步进入 Token Plan、Qoder 和 QoderWork,开发者不必等待完整权重发布,就可以提前试用。 为更了解海光信息在AI算力领域的布局与思考,大会期间,观察者网等媒体与海光信息总裁助理兼智能计算产品部总经理杜夏威展开对话,围绕云边端协同、开放生态建设、Token经济等话题进行了深入交流。 以下为对话实录: 提问:这次WAIC,海光展示了嵌入式AI的布局,算力从云端往端侧走,您觉得最大的应用机会在哪些场景? 杜夏威:端侧确实是AI一个非常重要的入口。
二 | 这次不管是会场的报告,还是我们展出的产品方案,都在强调云边端全域的协同。
三 | 这是一份相当激进的宣言。
四 | 因为端侧的触达面与数据中心端处于整个链条的两端,依托端侧产品可以更多地去拓展和覆盖市场侧的需求。 过去一年,前沿模型的竞争已经从谁的榜单分数更高,转向了更复杂的综合较量:模型能否稳定调用工具,能否理解真实网页和复杂状态,能否在长任务中保持约束,能否直接交付可运行的软件和媒体文件。 同时,端侧与数据中心端之间也有相应的耦合与协同。数据中心提供的强劲算力以及Token输送,一方面可以支撑端侧的应用场景,另一方面也可以作为端侧的高端算力补充。在Token快速发展的背景下,这样的方式能够更有效地实现市场用户和场景侧的覆盖。
五 | 提问:海光DCU一直在强调开放架构,从实际落地来看,开放架构给开发者和合作伙伴带来的最大便利是什么? 杜夏威:海光始终在坚持开放的原则,这里面有几个维度的考量。 第一个维度是从长线发展的角度来看,我们更像是为飞轮的启动提供点火和助力,保障它能够进入初期运转的状态。
六 | 但伴随AI产业链、软件栈以及模型的快速发展,除了自身贡献力量之外,我们也需要依赖生态侧的力量。
七 | 单看参数规模,已经很难判断一个模型真正能做什么。
八 | 所以,我们没有打算复述发布文案,也不准备只用几道数学题替它排座次。 通过开放的方式,一方面可以吸引更多开发者和伙伴加入以海光算力为核心的生态;另一方面也可以依托他们的力量,让大家在各自擅长和专注的领域发挥优势。这篇文章要回答的是一个更朴素的问题:Qwen 3.8 Max Preview 现在究竟能不能完成真实、复杂、可验收的工作? 在进入实测之前,先把这次发布中已经确认的事实、仍待验证的承诺,以及 2.4 万亿参数背后的实际意义拆开来看。 先把事实和口号分开 先把事实和口号分开。 截至目前,Qwen官方确认的核心信息并不算多:2.4T总参数规模;`qwen3.8-max-preview`已进入Token Plan、Qoder与QoderWork;后续将开放权重,但发布日期、许可证和最低部署要求均未公布;官方将提升方向概括为Coding与Cowork,覆盖全栈开发、数据分析和Office工作流等复杂长程任务。
九 | 第二个维度是,AI芯片以及DCU软件栈的发展需要形成全链条闭环,才能实现对各类场景的有效支撑。 这足以说明,Qwen 3.8是一款规模极大、推理预算极高、面向Agent场景设计的模型。
十 | 我们不仅聚焦于海光CPU、DCU和自身的软件栈,也致力于拉动整个产业链进入开放状态。 具体而言,我们一方面逐步开源开放自身的软件栈,另一方面联合国产GPGPU生态中的不同芯片厂商,推动软件栈和统一接口层面的开放合作,尽可能降低用户在不同芯片之间切换的额外时间和人力成本。但Qwen尚未公开完整模型卡、技术报告或统一评测表。 为了穿透宣传滤镜,我们选择用测试 K3 的同一套题目来检验它。逻辑非常简单:两者参数规模接近,且都将自己定位为顶级闭源模型的挑战者。 第三个维度是,希望通过这样的动作,引领和带动国产GPGPU厂商和生态的良性发展。整个产业链条的健壮和良性循环,是所有芯片厂商和模型公司实现可持续发展的前提和基础。 提问:您此前提出过“算力指标”与“Token吞吐量”并重的观点。本届WAIC上,海光更想传递的是算力有多强,还是算力转化为Token的效率有多高? 杜夏威:我们始终坚持以端到端的视角来看待底层算力对上层业务的支持。 在此前对 K3 的评测中,我们设计了一套覆盖复杂软件工程、长程工具调用、多模态状态理解和最终产物交付的测试集。无论是之前大家谈论大模型兼容度,还是后来谈论模型适配和Token吞吐量,我们最核心的检验指标始终是:海光DCU芯片能否有效支撑上层的业务逻辑。
十一 | 因此,如果行业普遍以Token作为衡量单位来评价芯片或模型的算力、智能化程度,我们也倾向于以同样的视角、结合用户习惯,来评价海光DCU对上层的支撑能力。这一次WAIC,我们就是按照这样的逻辑来呈现自身的技术和产品的。 提问:海光DCU已在20多个关键行业、300多个应用场景落地,但在大模型推理商业化方面,行业普遍面临算力投入高、回报周期长的困境。现在,同一套题目被原封不动地搬到了 Qwen 3.8 面前,约束条件、任务边界和评判标准完全一致。
十二 | Qwen 3.8 能否在统一条件下稳定完成复杂软件工程任务?能否在长时间工具调用后依然死守最初的约束?能否准确理解网页、截图、表格和文件之间的状态演变?又能否最终交付一个真正可以跑通、打开和检查的实体产物?这些问题的答案,远比再看一份厂商自测榜单更有价值。
十三 | 实测Qwen 3.8 (一)复杂 UI 的视觉解析与代码重构 重建结果 第一题看起来像一道常规的前端题,实际上同时考察了视觉识别、页面拆解和工程交付。 我们向模型上传了一张 2000 × 1091 的 NASA Webb Images 页面截图,只发送了一句话: 你是一个资深的前端开发工程师。请仔细观察这张科普网站的截图,并将其转化为单文件的 HTML 代码。 没有告诉它页面名称,没有提供素材地址,也没有补充技术栈、响应式或“像素级复刻”之类的要求。海光如何帮助客户缓解这个问题? 杜夏威:我们主要从两个视角来推进。
十四 | 第一个视角是作为算力供应方,要把握好自身的技术和产品,保障对模型快速迭代的有效支撑。过去一段时间,我们积极推进了市面上几乎所有主流大模型的适配,同时也在打磨芯片对上层Token吞吐的效率。 第二个视角是,这次WAIC我们也在积极呼吁,站在光合组织的角度,倡导产业链共同关注Token经济的良性循环,我们不希望重蹈当年软件行业在价值变现和商业闭环上的覆辙。 Token性价比的提升,是整个产业链共同努力的结果,我们应该享受这样的红利。但同时,我们也不应该以低价来衡量算力、模型和Token产业的价值,而应该突出它们对产业变革的贡献。
十五 | 模型必须自行识别截图中的信息层级,并决定如何在一个 HTML 文件里重新实现。 性价比会随着技术迭代持续提升,但与此同时,必须保障产业链各环节获得合理的商业利益,这样才能形成正向循环。 Qwen 3.8 Max Preview 顺利交付了一个可以直接打开的 index.html。
十六 | 页面不是把原截图塞进
十七 | 提问:您刚才提到Token正在成为AI时代的“数字石油”。对普通企业来说,Token经济到底意味着什么?它会怎样改变企业使用AI的方式? 杜夏威:Token的使用已经渗透到了个人层面,很多To C业务都能感受到Token带来的变化。
十八 | Webb Images 标题、整段介绍文字、两组共八个图片分类也全部保留,没有出现常见的错字、改写或凭空编造。
十九 | 尤其是双层导航,模型不仅识别出了Explore、搜索框、NASA 标志、News & Events、Multimedia 和NASA+ LIVE,也完整还原了第二层的 Webb、News、Overview、Science、Observatory、Multimedia、Team 和 More。对于B端用户,无论体量大小,都应该积极拥抱Token经济,尤其是中小企业,它们既是产业上下游的长尾,也是未来产业发展的新生力量,需要重点支持。对一项只有截图输入的任务而言,这说明它的视觉文字提取和页面语义拆分都很稳。 我们通过两种方式来支撑中小企业。
| 一种是通过云原生的算力和Token服务,让中小企业无需自建即可便捷地获取Token,尝试以大模型或智能体来升级业务。 页面中的 NASA 标志没有调用外部图片,而是用 SVG 重新绘制;底部天文图也没有依赖网络资源,而是用 Canvas 生成星空、星系核心和散落星体。
| 另一种是,对于身处高精尖或细分领域的企业,我们提供符合其预期的私有化算力规模,保障敏感数据和高价值资产能够在企业自己的业务体系内安全使用。这个选择让文件在断网环境下仍然能够完整显示,也说明模型确实理解了“单文件交付”的工程含义。 但它还没有达到像素级视觉复刻。模型知道页面由什么组成,却没有准确估计这些元素在目标分辨率中的绝对尺度;它完成了最显眼的桌面首屏,却没有继续检查窄屏和可访问性。这使 Case 1 的结论非常明确:Qwen 3.8 Max Preview 已经具备扎实的视觉到代码能力,第一版就能做到八成完成度,但距离闭源旗舰所追求的精细设计还原与产品级收尾,仍有一段肉眼可见的距离。 (二)复杂业务逻辑与动态数据可视化计算 我们给模型提供了 28 条多模型 API 运行记录、一份 AstraOps 品牌规范和一个 SVG 标志,要求它实现一个单文件、完全离线的运营驾驶舱。题目不只要求页面好看,还明确规定了五项核心指标的统计口径、四类数据图表、三级筛选联动、异常检测规则、明细表排序和成本情景模拟器。 Qwen 3.8 Max Preview 最终交付了一个 1203 行的单文件 HTML。所有数据、样式、SVG 图表和交互逻辑都内嵌在文件中,没有使用 React、第三方图表库、CDN 或网络请求。 我们直接调用其内嵌计算逻辑对原始数据进行校验,默认视图的五项结果与标准答案完全一致。 页面完整实现了题目要求的四类图表:每日模型请求量使用堆叠柱状图,成功率使用多折线图并绘制 97% 警戒线,成本—质量关系使用气泡散点图,请求量占比则使用环形图。 这些图表全部由原生 SVG 生成。 “云上+私有化”两种方式并行,既能提供低资产投入、高便捷性的云上Token服务,也能提供符合质量需求的中小规模私有化部署。
| 当企业需要快速迭代时,通过云上算力来支持;当业务进入可闭环状态时,通过私有化部署来保障数据安全和Token质量。柱体、折线节点、气泡和环形扇区都来自当前筛选后的数据,并提供模型颜色、坐标、数值标签和悬停提示。 提问:海光在软件栈建设上,从“可用”到“好用”目前走到了哪一步? 杜夏威:我们现在已经不再仅仅强调“可用”了。散点图中的横坐标确实按“总成本 ÷ 总请求量 × 1000”计算,纵坐标则是请求量加权质量分,气泡半径与请求量关联;并不是在一个固定坐标上摆四个装饰圆点。 Case 2 是 Qwen 3.8 Max Preview 第一次真正让人感到超出预期的地方。面对一份带有明确业务口径的结构化需求,它没有把主要精力浪费在华丽装饰上,而是先建立统一的数据状态,再让指标、图表、异常和模拟器共同消费这份状态。
| Day0级的适配已经非常普遍,我们更多关注的是是否能够开箱即用、开箱即好用,通过性能和Token吞吐来保障用户体验。除了时间筛选窗口的一个边界问题,首轮交付已经接近可以进入代码评审的内部工具原型。 (三)复杂规则驱动的建筑疏散仿真 第三题把难度再次提高。 这一次,模型需要根据一个 24 × 16 的建筑网格和一份仿真规则,构建包含 12 名人员、4 扇防火门、2 个出口和 1 个烟雾源的交互式疏散沙盘。人员速度不同,出口容量不同,烟雾会按固定周期扩散,D4 会在 12 秒时自动关闭。
| 此外,我们也开始转向前瞻性布局,推动芯片与模型的紧耦合协同。
| 系统还必须处理寻路、碰撞等待、出口排队、烟雾暴露、受困与恢复路径。
| 这类题非常适合识别模型是否在演戏。一个页面可以用 CSS 动画让小圆点看起来在移动,也可以预先写死 12 条轨迹,但只要用户提前关门或切换播放速度,伪仿真就会立刻露馅。我们已经针对部分大模型厂商的下一代模型迭代,提前开展芯片与模型的协同适配。 Qwen 3.8 Max Preview 交付的是一个 724 行单文件 HTML。这样才能从根本上解决问题,确保发布即可用,可用即好用。
| 源码中没有写死轨迹,也没有使用随机移动,而是建立了网格、门、人员、烟雾、出口和计划事件的独立状态,并以 0.5 秒为固定逻辑步长逐步推进。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 我们首先在初始门状态下调用页面自己的 A* 寻路逻辑,检查 12 名人员到最近出口的路径长度。 提问:今年超节点非常热,去年很多还在发布阶段,今年已经落地了。您认为接下来最大的瓶颈是什么? 杜夏威:超节点成为WAIC的热点,呼应了模型快速迭代、走向更大规模参数量的趋势。
| 十二个结果与验收基准完全一致。这意味着墙体展开、门格位置、两个出口坐标和四方向移动规则都没有解释错误。
| 海光的超节点今年已进入量产状态,我们联合光合组织上下游及整机合作伙伴,推出了基于海光CPU/DCU芯片的超节点方案。路径搜索使用普通格代价 1、烟雾格代价 8,并以到两个出口的最小曼哈顿距离作为启发函数。
| 除了硬件本身的量产,我们还需要关注服务能力的打磨,特别是软件栈的完善度。每个逻辑步都会根据当前门状态和烟雾区域重新规划,而不是在开始时生成一条永不改变的路线。在大模型推理场景中,PD分离和PV Cache缓存等技术手段对性能效率的提升至关重要。 Case 3 的意义在于要求 Qwen 同时维护空间、时间、人员、烟雾、门和出口六类相互影响的状态,而模型在首轮交付中通过了最关键的数值基准和事件边界。相比 Case 1 的视觉复刻,这更接近大模型在真实工程中的价值:它未必把每个细节都做到产品级,却能够从一份自然语言规则出发,建立一个可运行、可解释、还能被严格验证的系统。 (四)网页 3D 魔方 第四题要求模型从零实现一个真正可玩的 3×3×3 网页魔方:不仅要有 26 个立体块体和分层旋转动画,还要正确维护六面转动、算法队列、撤销重做、25 步确定性打乱、逆序复原以及供隐藏测试调用的 cubeTestAPI。 另一个值得关注的问题是,随着超节点规模扩大,故障率也会随之上升。 从运行记录来看,Qwen 3.8 Max Preview 对任务难点理解得相当深入。海光在这方面积累了较多经验,在训练侧和推理侧的故障管控与快速恢复方面,已形成了一套成熟机制和软件补偿方案。 所以接下来需要重点推进两个维度:一是软件系统工程化来保障最优性能,二是可用性与稳定性来保障大规模部署后的服务可持续性。 提问:现在大模型能做到万卡级的已经不多了,但十万卡级其实没有一个单一的模型能完全撑满。
| 它主动检查了动画速度、prefers-reduced-motion、applyAlgorithm() 的默认参数、非法算法的原子拒绝、打乱种子的确定性、撤销重做历史以及animate:false 下的 Promise 语义。这是否意味着未来的超节点要支撑多个大模型进行异构运算?这会带来什么问题? 杜夏威:以万卡或十万卡支撑单一用户时,国内真正做基模的厂商是聚焦的。它甚至已经开始考虑如何提取魔方引擎脚本并运行契约测试,说明其设计思路并没有停留在画一个“看起来像魔方”的界面。
| 但这一次,过程没有转化成结果。在完成 HTML 写入和正式测试之前,任务出现Internal error: terminated bug。 (五)从结构化数据到成片 最后一题要求模型根据两条异常事件和一组恢复数据,直接生成一支可以播放的 MP4。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 这一次 Qwen 成功完成了最终交付。生成的 astraops-incident-review.mp4 为 1920 × 1080、30fps、15 秒,共 450 帧,采用 H.264 编码和 16:9 画幅。他们需要持续的模型迭代,对训练集群几乎是锁定状态,可能每个月都要完成一次模型迭代。视频没有使用真人、机房或无关素材,而是以 AstraOps 的深色网格、数据卡片、折线和流动节点构成完整的动态图形叙事。因此,我们要有能力提供十万卡级的单一系统,来支撑单一模型的训练和持续迭代,这是我们具备的能力之一。 五个关键时间点全部出现了规定内容:片头展示 AstraOps 标志和“AI 服务异常复盘”;Kestrel-R1 阶段准确呈现 4,200ms、95.50%、+49.35% 和“严重”;Nova-Pro 阶段呈现 3,350ms、97.00%、+27.66% 和“警告”,没有把恰好 97% 错写成低于阈值;恢复阶段则正确展示 2,448→2,006ms、-18.05%、98.07→98.69% 和 +0.61 个百分点。 另一个维度是推理侧,现在已经进入海量并发的状态。用户喜欢用什么模型,我们不应绑定或限制。结尾以“让每一次异常都可解释”和 Detect · Explain · Recover 完成收束。未来的十万卡集群还需要保障另一种能力:在高并发下,支撑各类头部模型实现高性能的Token吞吐。 视频并非四张静态页面的简单硬切。 这两种场景的特点完全不同,对我们的考验也不一样,所以我们需要围绕海光芯片的十万卡交付,同时做好这两个层面的部署和支持。异常阶段的延迟折线会随时间上升,恢复阶段的延迟与成功率曲线分别向改善方向运动,卡片、节点和数据线承担了镜头衔接。所有文字和数字都是程序化绘制,因此停留期间没有生成式视频常见的跳字、融化和标志变形。 主要问题出在对比度。片头日期、部分指标卡、恢复阶段的旧值以及结尾英文使用了较低透明度,在深色背景上显得过暗。Case 5 证明 Qwen 3.8 Max Preview 的交付边界并不局限于网页和代码。它能够读取结构化事件,组织时间轴,再通过程序化渲染输出符合规格的最终媒体文件。虽然视觉精修还没有达到专业动效团队的水平,但从一份 JSON到一支可直接播放的复盘视频,这已经是一个完整而有效的生产闭环。 结论 成功交付的四项任务表明 Qwen 3.8 Max Preview 能够理解视觉输入,建立数据产品,维护复杂仿真状态,并把结构化信息转化为最终媒体文件。
| 尤其是 Case 2 和 Case 3,模型不仅做出了正确的界面,还通过了加权指标、时间边界、路径规划和烟雾扩散等确定性校验。这类能力比一张公开榜单更接近开发者真正需要的生产力。 它最突出的优势,是对复杂需求的结构化拆解能力。面对长提示词时,Qwen 通常能够识别哪些内容属于数据层、状态层、表现层和测试契约,并将它们组织到同一个交付物中。Case 2 的统一筛选状态、Case 3 的固定时间步与动态重规划、Case 5 的数据驱动时间轴,都体现了这一点。 它的第二个优势,是首轮交付的完整度。
| 除 Case 4 外,其余任务都不是代码片段或半成品说明,而是可以直接打开、运行或播放的文件。模型也表现出较强的离线工程意识:使用原生 SVG、Canvas、CSS 和本地编码链路完成任务,没有依赖外部框架掩盖实现难度。 但短板同样明确。
| 它最突出的优势,是对复杂需求的结构化拆解能力。面对长提示词时,Qwen 通常能够识别哪些内容属于数据层、状态层、表现层和测试契约,并将它们组织到同一个交付物中。Case 2 的统一筛选状态、Case 3 的固定时间步与动态重规划、Case 5 的数据驱动时间轴,都体现了这一点。 它的第二个优势,是首轮交付的完整度。除 Case 4 外,其余任务都不是代码片段或半成品说明,而是可以直接打开、运行或播放的文件。模型也表现出较强的离线工程意识:使用原生 SVG、Canvas、CSS 和本地编码链路完成任务,没有依赖外部框架掩盖实现难度。
| 但短板同样明确。 第一是视觉精修。
| Qwen 能判断页面由哪些元素构成,却不总能准确估计绝对尺度、留白和信息对比度。Case 1 的整体缩小和 Case 5 的暗色文字都属于同一种问题:结构正确,最后一轮设计校准不足。 第二是边界收尾。
| Case 2 的时间筛选会丢失成本环比基线,Case 3 的复杂占位依赖存在理论风险,Canvas 人员选择也没有完整的键盘通道。这些问题不会破坏默认演示,却可能在真实用户和复杂输入下出现。 第三,也是最重要的一点,是长任务稳定性。Case 4 中,模型已经分析到 API 默认值、算法原子性、动画 Promise 和隐藏契约测试,却在交付前因内部错误终止。对于开发者而言,一次没有落盘的中断足以抵消大量高质量推理。模型能力的上限很高,但能否稳定走到终点,仍然决定了它是否可以被放心放进无人值守的工作流。 它的能力上限已经进入前沿第一梯队,优秀案例甚至接近可投入代码评审的水平;但视觉精修、极端边界和长任务成功率,仍然决定了它距离最可靠的旗舰模型还有多远。 至于 2.4 万亿参数的开放权重版本能否保持同样能力、推理成本是否可控、社区能否真正部署,以及这次中断是偶发事件还是稳定性信号,都需要等权重、技术报告和更多独立复测出现后才能回答。 但有一点已经可以确认:Qwen 3.8 Max Preview 不是只靠参数规模制造声量。至少在这组测试中,它确实交出了几份足以让闭源旗舰认真对待的作品。 Ref: https://explainx.ai/blog/qwen-3-8-max-preview-open-weight-token-plan-july-2026 作者: Wang Shijie。 Current article:http://vi7ins8.zongchaeiwengshuabaisisuofu.sbs/news/20260826_1563.html Published on:04:43:06 |






































