知识库

运维笔记

聚焦数据中心自动化、Python 探针、DCIM 和 AI 内容流水线。

返回首页
Infrastructure

ASUS Pro Q570M-C/CSM BIOS翻车实录:DASH IPMI选项消失的排查与自救

这板子到底怎么了? 上个月我们团队给一台新上线的监控节点配了块 ASUS Pro Q570M-C/CSM。选它的理由很简单——官方说支持DASH扩展卡,能实现类似IPMI的带外管理。对于没有独立BMC的机器,这玩意儿简直就是救命稻草。 结果板子到了,DASH卡插上,进BIOS一翻 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Networking

Android 7.1.1 Nougat App Standby 网络锁死?手撕后台限制与 GCM 失联修复方案

症状:你的 App 在后台“失联”了 我猜你遇到的情况是这样的:App 明明收到了 GCM(Google Cloud Messaging)推送,然后立刻发一个 API 请求出去——结果,请求超时了。或者更恶心,App 在后台待机几分钟后,所有网络调用全部失败,只有重新点亮屏幕才能 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

SRE & Observability

2026年K8s监控选型硬核指南:我踩过的坑和最终留下的5个方案

兄弟们,2026年了,K8s监控这摊子水是越来越浑。 上周我们一个生产集群的Prometheus直接OOM挂掉,原因是某个团队把metrics label基数干到了几千万。我半夜爬起来配remote write的时候就在想:这年头到底什么方案才是真能用的? 别跟我扯什么 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Developer Tools

PostgreSQL 分区表最佳实践:从踩坑到真香,一个老司机的血泪总结

兄弟们,今天聊点硬核的——PostgreSQL 分区表。 先别急着划走。我知道你们在 Reddit 上看到过一堆吐槽,什么“分区表就是个坑”、“查询计划慢成狗”、“维护起来想骂娘”。没错,这些我都经历过。上个月我们生产环境的一个分区表差点把监控搞炸了,原因是分区数量冲到 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

Redfish API 报错 400/500?手撕 iLO 和 iDRAC 的诡异错误码修复实录

先说说这破事儿是怎么来的 上个月我们搞了个自动化运维脚本,用 Redfish API 批量给新到的 HPE Gen11 服务器做初始配置。结果翻车了。 两台 Gen11,一台 iLO 6 v1.53,一台 iLO 6 v1.66,配置一模一样。脚本跑过去,老的稳如老狗,新的疯狂报 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

AI & ML Infrastructure

LLM时代,新DSL的生存法则:别跟AI抢饭碗,给它造工具

写在前面:DSL已死,DSL万岁? 上周Hacker News上有个帖子炸了,标题就是"How a new DSL may survive in the era of LLMs"。53分,19条评论,不算多,但讨论质量出奇的高。评论区里有个老哥的回复我印象特别 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Cloud & DevOps

EKS vs AKS 2026 生产对决:我踩过的坑与真实成本对比

别被云厂商的营销话术骗了 今年我们团队做了个痛苦的决定——把主力生产集群从 AWS EKS 迁移到 Azure AKS。不是因为我们喜欢折腾,而是因为账单和运维体验逼的。 先说结论:EKS 和 AKS 在 2026 年都已经非常成熟,但它们的代价结构、网络模型和身份管理差异巨大。 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG