运维技术分享

1. 问题背景 先说一个真实的排障场景。 某公司用 vLLM 自部署了一个 7B 模型,挂在公司内部的代码助手服务后面,白天内部开发同事...

问题背景 “数据库变慢了”是运维和 DBA 最常收到的一类反馈,但这句话本身信息量几乎为零——是所有查询都慢,还是某几条特定的...

一、问题背景 某天下午三点,监控系统推送了一条告警:数据库服务器磁盘 IO 使用率达到 95%,业务方几乎同时反馈订单系统出现大量...

一、问题背景 生产环境中最常遇到的运维场景之一就是服务器负载突然飙升,导致业务响应变慢甚至不可用。监控告警平台频繁报警 ...

一、问题背景 传统存储架构面临的挑战: 容量扩展困难:单机存储容量有限,扩容需要停机或数据迁移 性能瓶颈:单机 IOPS 和吞...

问题背景 SSH 是 Linux 服务器最常用的远程管理方式,也是攻击者最常攻击的入口。弱密码、暴力破解、未授权访问等安全问题频发,需...

扫码添加小助理,备注【SQL常见100面试题解析】免费领取

一、问题背景 生产服务器运行一段时间后,磁盘空间不足是常见问题。数据库日志、应用日志、用户上传文件、备份文件等持续增长,...

问题背景 大模型参数量越来越大,从 GPT-3 的 175B 到 LLaMA 70B、Qwen 72B,单张 GPU 显存(24GB/48GB/80GB)往往无法容纳完整模型。多 GPU 推理...

#大学生专属暑期训练营 特惠来袭🔥💰 原价 99 元,组队报名超划算:双人拼团 9.9 元|三人拼团仅 1.99 元✅ 报名即赠 Linux 全å¥...

服务器“卡顿”不是一个根因,而是用户对响应时间变长、SSH 操作迟缓、接口超时或任务堆积的统称。CPU 打满会卡,内存回收和交换会...

Docker Swarm 迁移到 Kubernetes,最危险的做法是把 docker-compose.yml 逐字段“翻译”成 Deployment YAML,然后直接切流。两者都能运行容器,但关键...

声明式 Pipeline 频繁失败,通常是节点环境漂移、工作区残留、容量不足、凭据暴露、未受控并发和不可观测发布过程的组合问题。处理顺...

GPU 利用率突然 100%、显存被占满、进程列表为空但设备持续繁忙、某张卡温度和功耗异常,这些现象不能只靠一张 nvidia-smi 截图下结论。...

先说结论:有时能恢复,但没有任何一条命令可以保证把 rm -rf 删除的内容完整找回来。能否恢复,主要取决于文件是否仍被进程...

一、问题背景 “系统变慢了”是运维群里出现频率最高的一句话。来源可能是用户、业务方、监控告警、值班人员。症状也很杂...

一、问题背景 Nginx 几乎是每个互联网公司的接入层标配,但很多初中级运维的状态是: 配置写得过且过,路径跳转、rewrite、HTTPS 全...

K8s Pod OOM 排查:从 limits 设置到 JVM 调优 一、问题背景 在 Kubernetes 上跑 Java 服务,最让人头疼的故障之一就是 Pod 被频繁 OOMKilled...

面向初中级运维工程师 / 系统管理员 / DevOps 工程师。本文按”现象 → 命令 → 关键指标 → 根因 → 修复 → 验证 → 复盘”的路径...

引子:一次被监控救回来的库 去年 Q2 一次大促。凌晨 1 点,订单库的 P99 延迟从 80ms 涨到 1.2s,业务没炸,但订单量明显下滑。 值班...

Copyright © 2012-2022 YUNWEIPAI.COM - 运维派 京ICP备16064699号-6
扫二维码
扫二维码
返回顶部