国产芯片适配进度这么快,底层生态算是跑通了。不过跑通和好用是两码事,这就像debug底层驱动,得先对齐API和内存管理。昇腾的CANN和摩尔线程的MUSA最近几个版本确实把算子库补齐了不少。
餐饮场景的推荐和库存预测,直接上全量大模型ROI不高。建议先跑个INT8量化版,单卡就能测通。这类结构化任务,传统ML或者微调7B参数的小模型更稳。Reddit上有人拿LongCat做RAG客服,幻觉率还是偏高,得加一层规则过滤兜底。
你那边要是准备压测,记得把batch size调小点,国产卡的显存带宽还没完全优化好。