[{"data":1,"prerenderedAt":25},["ShallowReactive",2],{"news:721":3},{"code":4,"message":5,"data":6},200,"操作成功",{"createBy":7,"createTime":8,"updateBy":7,"updateTime":8,"id":9,"title":10,"titleEn":11,"keyword":12,"newsDescribe":13,"urlPath":14,"tourl":15,"articleContent":16,"publishType":17,"briefIntroduction":18,"sort":19,"type":17,"publishStartTime":20,"showTime":15,"publishEndTime":15,"publishStatus":21,"isValid":21,"isOld":19,"remark":15,"nickName":15,"numberOfViews":22,"time":23,"year":24},45,"2026-06-01 14:51:23",721,"面向离线场景的批量推理：优化企业推理预算的新选择","721","批量推理、大模型推理、全程托管、吞吐能力提升、算力调度引擎","蓝耘批量推理将团队碎片化的请求整合为规模化作业，让每一次调用都更有效率，为团队推理成本带来结构性下降","public/cloud-official/2026-06-01/99e4ae91a7a54e1e9ac78da292088f6a.png",null,"\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">大模型推理的账单，很多团队其实从来没有仔细算过。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">并非不想算，是大家太忙了。忙着跑任务、忙着修 bug、忙着赶在 deadline 前出结果——等到月底财务把账单拍在桌上，看着那一串数字，只能面面相觑。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">其实，\u003C/span>\u003Cstrong style=\"font-size: 12px;\">很多不需要实时响应的推理任务，根本没必要用昂贵的实时接口去硬扛。\u003C/strong>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">针对这些高频的离线、非实时任务，\u003C/span>\u003Cstrong style=\"font-size: 12px;\">蓝耘元生代 MaaS 平台推出了「\u003C/strong>\u003Cstrong style=\"font-size: 12px; color: var(--weui-LINK);\">批量推理\u003C/strong>\u003Cstrong style=\"font-size: 12px;\">」功能\u003C/strong>\u003Cspan style=\"font-size: 12px;\">。它的逻辑很简单：把“不赶时间”的任务集中在后台托管、统一调度，用更平稳、更低成本的方式帮团队跑完任务。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cstrong style=\"font-size: 12px;\">&nbsp;一次提交，全程托管：告别周末加班\u003C/strong>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">很多电商运营团队，每天面对数万条用户评价。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">人工分析需要数十人的团队，周期长，难以快速响应用户反馈。情感倾向和核心诉求识别不准确，产品迭代总是慢半拍。如果用实时API跑，成本高、并发受限，工程师得守着脚本处理限流和重试。一个本该周五提交、周一拿结果的任务，就这样变成了加班的理由。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">蓝耘批量推理支持\u003C/span>\u003Cstrong style=\"font-size: 12px;\">一站式任务调度，一次提交、后台全程托管\u003C/strong>\u003Cspan style=\"font-size: 12px;\">。任务自动排队，遇到异常会自动重试。工程师扔下任务就能安心过周末，告别频繁调用和维护并发脚本的负担。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">\u003Cimg src=\"https://oss.lanyun.net/public/cloud-official/2026-06-01/2e43304ba56c4a8699e66bb6c3de38cc.png\">\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cstrong style=\"font-size: 12px;\">动辄百万级文档，没必要为低延迟买单\u003C/strong>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">做企业内部知识库的团队，大概都经历过这个阶段：要把邮件、会议纪要、聊天记录这些日积月累的非结构化文本，变成可检索的知识资产。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">这个过程通常只需要做一次（或定期增量更新），用户对延迟完全不敏感。但因为数据量极大——动辄上千份文档、数十万条消息——如果全按实时接口的价格跑向量化，月底的账单往往高得让人肉疼。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">这种“一次性大批量、不赶时间”的预处理任务，用高并发实时调用等于不必要的开销。而通过蓝耘批量推理，推理价格相比标准方案\u003C/span>\u003Cstrong style=\"font-size: 12px;\">大大降低\u003C/strong>\u003Cspan style=\"font-size: 12px;\">，用更低的成本帮团队把底座建好。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">\u003Cimg src=\"https://oss.lanyun.net/public/cloud-official/2026-06-01/f9cf879692284359ad90d783ceca4682.png\">\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cstrong style=\"font-size: 12px;\">批量跑评估，成本与效率更好平衡\u003C/strong>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">很多企业在选型大模型时，需要测试多个供应商（如OpenAI、Anthropic、DeepSeek）的数十个模型，测试成本高、周期长。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">模型版本迭代频繁，每次更新都要重新跑一遍效果评估，少则几百条，多则几万条样本。这类任务结果不影响线上服务，跑慢一点无所谓，但量大、频率高、对成本极度敏感。如果一直用实时接口去跑评估，研发成本会明显上升。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">蓝耘通过自研的算力调度引擎，将这些碎片化的评估请求整合为规模化作业。集中式调度可以优化 GPU 利用率、减少资源闲置，让评估任务在后台安静、高效地跑完，既\u003C/span>\u003Cstrong style=\"font-size: 12px;\">不占用线上资源，也能让推理成本显著下降\u003C/strong>\u003Cspan style=\"font-size: 12px;\">。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">\u003Cimg src=\"https://oss.lanyun.net/public/cloud-official/2026-06-01/34db9153efbd41429d549992c6d822ec.png\">\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cstrong style=\"font-size: 12px;\">十亿级流水线，需要更可控的运营成本\u003C/strong>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">不少内容平台需要定期对海量存量内容做合规检测、摘要生成或分类打标，每次处理量都是十亿级起步。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">这属于典型的“流水线业务”：定时触发，凌晨跑、早上看结果，对实时性没有要求。但如果用实时接口，高并发下的稳定性和昂贵的调用成本，会成为运营团队卸不下的重担。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cbr>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cspan style=\"font-size: 12px;\">蓝耘批量推理\u003C/span>\u003Cstrong style=\"font-size: 12px;\">在集中调度下吞吐能力明显提升\u003C/strong>\u003Cspan style=\"font-size: 12px;\">，高并发时任务处理更稳定。通过智能分配任务队列，可以有效避免峰值拥堵。同等算力投入下，可支撑数倍于传统方式的任务规模，让十亿级内容流水线的运营成本变得更清晰、可控。\u003C/span>\u003C/p>\u003Cp style=\"line-height: 1.5;\">\u003Cstrong style=\"font-size: 12px;\">蓝耘批量推理将团队碎片化的请求整合为规模化作业，让每一次调用都更有效率，为团队推理成本带来结构性下降。\u003C/strong>\u003C/p>",2,"模型推理的账单，很多团队其实从来没有仔细算过。并非不想算，是大家太忙了。忙着跑任务、忙着修 bug、忙着赶在 deadline 前出结果——等到月底财务把账单拍在桌上，看着那一串数字……",0,"2026-05-28 00:00:00",1,23,"00:00:00","2026年05月28日",1785755330074]