2026/08/10发布
一次生产事故引发的镜像瘦身实战:从1.2GB到89MB,构建时间缩短68%,部署耗时减少75%。多阶段构建、依赖缓存、.dockerignore
2026/08/09发布
线上模型在长序列下OOM崩溃后,从零手写Attention对比标准实现与FlashAttention/稀疏Attention的差异。附PyTor
2026/08/09发布
PyTorch模型上线CPU推理单次18ms,改用ONNX Runtime后降到7ms,换TensorRT后稳定在2.8ms。本文记录从PyTo
2026/08/09发布
面试官问二分查找,新人答「就是一半一半找」但写不出代码——这是典型没建立直觉。我对比了Visualgo、DSV、Algorithm-Visual
2026/08/09发布
用Llama 3 8B处理50页财报时上下文爆掉,实测三种RoPE扩展方案。PI、NTK、YaRN从原理到调参,手写代码实现,给出16k/32k