
摘要2023年3月xx市某机器人集团启动多模态大模型智能清扫机器人平台建设我作为架构师主导了平台的整体架构设计与研发工作。该平台为集团多个机器人项目提供了统一的调度工具涵盖图像识别模仿学习移动应用等八大子系统。系统基于4R原则定义边界分模块分配关键性能指标到指定系统1年内实现云边端系统聚焦关键微服务通过立体层次化的治理历年实现大并发系统毫秒级响应通过全局REquestId实现逻辑可视化的链路追踪系统把解决问题实践降低到1天之内性能指标满足率达到90%仪式上。平台历时12个月完成近三年累计交付中小型智能机器人项目显著提升了交付效率成为集团标杆性工程。正文随着工业4.0与智能制造的持续推进企业对高效可靠可自动化集成的智能设备需求迅速增长清扫机器人作为智能制造与智慧运维的重要组成部分市场需求日益旺盛。同时我国已进入人口负增长阶段劳动力供给持续减少用工成本不断攀升进一步推动企业加速自动化与智能化升级机器人替代人工已成为行业加速自动化与智能化升级机器人替代人工已成为行业发展的普遍趋势。然而传统清扫机器人系统普遍存在标准化程度低自动化能力不足智能化水平有限等问题难以满足企业日益复杂的业务集成需求。尤其在机器人使用的高峰时段老旧系统频繁卡顿响应缓慢甚至宕机等情况同时缺乏移动端能力无法满用户随时随地高效操作的需求。在此背景下为响应市场对智能化与自动化集成的迫切需求自2023年3月起苏州某机器人集团正式启动多模态大模型智能机器人研发项目致力于打造面向未来的新一代智能清扫机器人平台。在该项目中我担任平台系统架构师全面负责整体架构规划核心方案设计以及关键技术落地实施。平台面向集团下12家子公司200多家B类用户日均新增原始数据量达到2.4TB,峰值任务并发量达到2000rps,提供涵盖调度图像识别模仿学习数字孪生移动应用等八大核心业务子系统。在技术架构方面平台采用云原生服务设计理念后端基于SPring Cloud Alibaba技术系构建前端采用vue3element plus技术栈。针对系统任务的并发大响应缓慢的问题我们主要基于架构的4R原则聚焦核心问题并通过业务拆分分布式缓存读写分离等手段最终实现高并发高可靠高性能的机器人平台系统。由于系统在需求调研阶段已明确确定支撑每日10TB的海量新增数据2000的RPS任务请求等经过架构团队的多轮调研决定自上而下分阶段分层次逐步细化的方案策略实现我们的大并发系统。从前端到后端系统分为5个层级应用层网关层缓存层服务层设备层在应用层我们采用UI缓存在网关层实现限流路由黑白名单等在缓存层实现数据的读写分离在设备层通过docker技术实现快速拉起进程服务实现系统的可靠性。在实际开发中我们系统平台分为三期一期实现机简单但必要的最基础的功能功能二期通过集群与缓存聚焦关键的系统性能指标优化三期基于可视化追踪系统实现全面三高高性能高扩展高可用系统。在本系统的研发过程中我们通过拆分与分知聚聚焦于优化追踪与定位完成了多模态大模型智能清扫机器人系统的建设与实现具体实现如下。一.职责分离与分而之治基于系统业务的实际性能需求并结合4rd的架构原则从顶层到下层逐步划分系统模块以及微momo服务实现基本的初步的系统捽性在多模态大模型的机器人的初期研发过程中系统需要支付多少B类管理用户多少终端用户多少运维人员多少量的任务数据并没有一个确切的量化数据并且行业内成熟的系统与我们的机器人平台业无并不一致参考的意义并不大因此我们基于实际的业务场景划分系统与模块定义具体的性能指标并把核心指标分配到指定的系统模块中便于治理与优化。首先划分系统范围定义系统边界如app只做展示与下发任务调度服务只关注任务生命周期等其次分析系统内有哪些角色并为哪些角色提供服务如系统有类似卡和的B类分销商有家庭用户有运维人员公司管理人员在系统开发之前要深刻理解他们的诉求接着思考系统角色模块服务之间的关系抽象复用通过模块最后定义系统内外内部之间的运行规则。按照4R原则结合实际在3个月内上线一个基础测试版本6个月上线一个稳定高性能的国内版本12个月上线一个全球化版本深得用户青睐。二.聚焦与优化关键微服务聚焦关键微服务锁定优化范围通过立体层次化得方式与手段实现微服务的性能优化。由于机器人的地图与海量运行数据需要APP,WEB端可视化大屏展示一个任务的请求与反馈的连接会涉及到多个层次多个微服务优化不是一蹴而就的。为了在各种终端毫秒展示地图图片允许在每种终端设置UI缓存为了实现高性能流量转发与限流部署了Restry网关避免任务地图数据查询数据库实现分布式缓存以及本地缓存为了提升任务地图业务的流畅使用通过数据库层面的读写分离实现调度与大屏业务分离。经过整体立体的优化在流量洪峰2000RPS时依然实现了南北向接口0.8秒内响应东西向接口50毫秒内响应同时支持20多个子系统稳定运行。三.可视化追踪与定位优化通过全局的request实现横跨多个微服务的链路追踪系统并通过逻辑可视化实时展示读卡点的相关服务进程与代码位置可帮运维与研发人员迅速定位问题。由于系统部署方式比较复n杂既有海外云边端系统又有国内的端云系统涉及相关服务大概20多个当系统异常卡顿时定位相当困难因此基于场景我们定义并实现了一套全局链路追踪系统。当一个任务请求时系统先根据部署集群区域机器服务等动态生成一个可持续的流水号REQUESTID,定义标准一体化的HTTP,mqtt,ws协议消息体接着在调用关联服务器时带上它并记录日志当系统问题触发时通过requestID搜集相关日志以及关联时序数据并通过大屏可视化回放从而快速定位到问题点。通过可视化大屏链路追踪把系统发现到解决问题实践从2周缩短到1小时系统的性能指标满足率达到90%以上。经过12个月的项目研发于2024年3月多模态大模型智能清扫机器人平台系统顺利上线并运行至今在近3年时间内先后实施交付了10多个中小型项目交付项目任务的并发量达到了2000rps,50毫秒内响应并且机械臂的抓取成功率达到了82%在集团内部成为了一个标杆项目深得集团青睐。由于该平台对性能可靠性可扩展性要求极高并且项目周期又短项目开发可谓困难重重。但由于我和研发团队ua都非常重视架构研发的过程管理并对高并发涉及架构的方法论比较熟悉最终按质量保证了项目的顺利交付。由于架构合理且考虑周全整体进展比较顺利得到行业内外的高度认可。当然站在架构师的角度回顾在本项目中还存在一些不足如由于机器人清扫任务的高峰期都在用户上班之后时间高度一致并且本地临时缓存的默认过期时间相同可视化大屏打开时会有大量缓存穿透的发生导致可视化大屏缓慢展示数据并有部分crash错误后续可以在本地缓存穿透的发生导致可视化大屏缓慢展示数据并有部分crash错误后续可以在本地缓存中设置不同的过期时间设置缓存默认值以及从数仓DWS中获取数据从而极大降低展示异常的风险。展望未来我们将继续推进多模态大模型智能青岛机器人平台的技术研究与产品优化持续积累经验于技术储备为构建更高效更智能的机器人人平台奠定坚实基础