2026/08/07发布
生产环境AI客服被提示注入攻破后,我搭了一套「规则引擎+独立审核模型」双引擎护栏。本文给出完整代码、压测数据(召回率98.4%、P99延迟31m
2026/08/06发布
真实部署MoE模型时,单机显存不足导致推理中断。通过对比3种部署方案,用vLLM+量化+多机专家并行拿下了45并发下的稳定推理。本文记录完整的方
2026/08/05发布
2024年5月,我把公司一个7B Dense模型改成MoE,训了4000步loss不降,专家坍缩到只剩2个。这篇文把DeepSeek-MoE的架
2026/08/04发布
单张T4上vLLM跑Llama3-8B直接OOM,换llama.cpp量化后能跑但并发一高就排队超时。这篇文章用真实部署案例拆解三个推理引擎的底
2026/08/03发布
真实场景:处理5万字技术文档做知识问答,普通RAG召回碎片化导致回答错误率37%。本文对比RAPTOR和GraphRAG两种长文本增强检索方案,