知识库

运维笔记

聚焦数据中心自动化、Python 探针、DCIM 和 AI 内容流水线。

返回首页
Infrastructure

Proxmox 9.x 升级后 SATA SSD 读写异常排查与修复:一个 Homelab 踩坑实录

警告: 本文基于真实社区案例和工程实践。如果你正被 Proxmox 9.x 下的 SATA SSD 读写问题折磨,别急着换硬件,先试试这里面的方法。我踩过的坑,你大概率也会遇到。 一、症状:升级后,SSD 变“废盘” 事情是这样的。我们 homelab 群里最近炸了锅——好几个人 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Data Center

Cisco UCS C240 M7 对比 Lenovo ThinkSystem SR630 V3:NVMe 存储基准测试与真实部署血泪史

开篇:为什么这场 NVMe 对决值得你花时间看 我见过太多团队在采购服务器时,对着 CPU 核心数和内存容量一顿猛算,结果存储子系统直接成了被忽略的短板。直到生产环境 IO 延迟炸了,监控告警刷屏,才慌慌张张去查问题根因。 今天聊的这两台机器——Cisco UCS C240 M7 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Cybersecurity

CrowdStrike Falcon Sensor 部署配置实战:从 GPO 到 InTune 的避坑指南

老实说,CrowdStrike Falcon 的 Sensor 部署,看起来就是个双击安装包的事,对吧?但真到了生产环境,尤其是你要管几千台机器的时候,坑多得能让你怀疑人生。我最近刚帮一个客户从传统 AV 迁移到 Falcon,整个过程下来,最大的感触是:文档写得再好,也不如自己 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

大厂故障通知机制深度拆解:从PagerDuty到内部Status Page的基建实践

一、核心痛点:为什么大厂的通知体系比小公司复杂十倍? 上周跟一个刚跳槽到某FinTech的朋友喝酒,他吐槽了一件事:原公司(200人左右)出故障就是群里吼一声,或者直接打电话。到了新公司,光是搞清楚“故障发生时该通知谁”就花了两周。 这其实是个经典问题。Reddit …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Cloud & DevOps

浏览器里跑K8s?ngrok工程师把Kubernetes移植到TypeScript的硬核实践

这事儿到底有多离谱? 说实话,我第一次看到“I ported Kubernetes to the browser”这个标题,第一反应是——又是个玩具。 浏览器里跑K8s?听起来像那种Hackathon项目,周末搞个demo,然后丢到GitHub上吃灰。但ngrok的工程师Sam …

Tan Jia Hui

Tan Jia Hui

DCIM ENG