Dell Server Memory Error hatası, PowerEdge’de bir veya daha fazla DIMM’in ECC/parity veya training hatası verdiğini gösterir: iDRAC’ta Memory, POST’ta beep/LED, OS’ta MCE/EDAC. Kısa cevap: Önce hangi slot / hangi severity (Correctable vs Uncorrectable); reseat ve population kurallarını doğrulayın; tekrarlayan/uncorrectable ise DIMM veya board RMA. Temel mimari: PowerEdge Nedir?. Log: iDRAC. Boot ilişkisi: Boot Sorunu.
Bu rehber özellikle şu ekipler için yazılmıştır:
- iDRAC’ta “Memory Device Status: Critical” gören sistem yöneticileri
- Correctable ECC flood ile Uncorrectable crash’i ayıran operasyonlar
- DIMM reseat / slot taşıma prosedürünü standartlaştıran ekipler
- Garanti RMA öncesi kanıt toplayan BT liderleri
Hızlı Özet
- Memory Error = DIMM/kanal sağlığı; çoğu zaman tek slot ile başlar.
- Correctable = ECC düzeltti (izle/eş); Uncorrectable = veri bozulması / panic riski.
- iDRAC Lifecycle / SEL: bank, slot (A1, B2…), error count.
- Reseat → aynı DIMM başka slot → bilinen iyi DIMM testi.
- Population / hız / rank uyumu şart — Satın Alma.
- VMware ballooning ≠ fiziksel DIMM arızası — Ballooning.
- Sonraki liste: Dell Server CPU Error.
İçindekiler
- Memory Error Nedir?
- Correctable vs Uncorrectable
- Belirtiler ve Log
- Adım Adım Çözüm
- Population ve Uyumluluk
- Yaygın Hatalar
- Kontrol Listesi
- Leon-X ile Sonraki Adım
- Sık Sorulan Sorular
- Kaynaklar

Görsel: Pexels - Computer motherboard (DIMM / sunucu donanımı bağlamı).
Memory Error Nedir?
PowerEdge’de bellek alt sistemi ECC registered (RDIMM/LRDIMM) DIMM’ler ve memory controller’dan oluşur. “Memory error” şu ailelerden biri olabilir:
| Tip | Örnek |
|---|---|
| Correctable ECC | Tek bit düzeltilmiş; sayaç artıyor |
| Uncorrectable / Multi-bit | OS panic, PSOD, reboot |
| Training / Config | POST’ta bellek yok veya hız düştü |
| Predictive failure | iDRAC “Replace” önerisi |
Kısa tanım: Dell Server Memory Error, PowerEdge’de bir DIMM veya bellek kanalının ECC/training hatası üretmesi durumudur; teşhis slot kimliği + severity ile başlar, çözüm reseat, izolasyon testi veya RMA’dır.
Sanallaştırma tarafında bellek baskısı ayrı konudur — CPU Overcommit · Ballooning.
Correctable vs Uncorrectable
| Correctable | Uncorrectable | |
|---|---|---|
| Etki | Genelde ayakta kalır | Crash / veri riski |
| Aksiyon | Trend izle; sık tekrar → değiştir | Hemen izole et / RMA |
| Log | “Correctable memory error” | “Uncorrectable”, MultiBit ECC |
| Aciliyet | Planlı bakım | Kritik |
Pro Tip: Aynı slot’ta correctable sayacı saatler içinde hızla artıyorsa “bekleyelim” demeyin; Uncorrectable’a giden yol çoğu zaman buradan geçer.
Belirtiler ve Log
- iDRAC System → Inventory → Memory veya Alerts
- Lifecycle Log / SEL:
Memory Device, DIMM location - POST: memory configuration warning, beep kodları (modele göre)
- OS: Windows Bug Check, Linux MCE, VMware purple screen
- Amber system health LED
iDRAC erişimi yoksa: Cannot Connect · IP Not Accessible.
Adım Adım Çözüm
1) Belgele
- Service Tag, model (R750/R760…)
- Hatalı DIMM slot etiketi (ör. A1)
- Correctable mi Uncorrectable mi?
- Son firmware/BIOS tarihi — Firmware
2) Soft kontroller
- iDRAC’tan clear pending alerts (kök nedeni silmez; temizlik)
- Sunucuyu maintenance’e al (cluster ise) — Cluster
3) Fiziksel izolasyon (ESD!)
- Gücü kes (veya hot-plug desteklenmiyorsa prosedüre uy)
- Hatalı DIMM’i çıkar, kontakları kontrol et, reseat
- Aynı slota geri tak → test (memtest / üretim yükü / iDRAC)
- Hata sürerse DIMM’i bilinen iyi boş slota taşı (aynı kanal kurallarına dikkat)
- Eski slotta hata yok, DIMM başka slotta hata → DIMM arızalı
- DIMM her yerde OK, slot sürekli hatalı → board/kanal şüphesi
4) RMA / yedek
- Dell Support’a SEL ekran görüntüsü + slot
- Yedek DIMM: aynı kapasite, hız, rank, RDIMM vs LRDIMM karıştırma
- Değişim sonrası 24–48 saat izleme
Boot’a düşüyorsa: Boot Sorunu · BIOS Boot Loop.
Population ve Uyumluluk
- Whitepaper’daki slot doldurma sırası (CPU0 önce, matched pairs)
- Karışık boyut/hız → en düşük hıza düşme veya config fail
- Mirror / spare memory açıksa kapasite ve hata toleransı değişir
- Üçüncü parti DIMM: HCL / Support Matrix riski
Performans bağlamı: Performans Optimizasyonu · BIOS Optimize.
Yaygın Hatalar
- Correctable flood’u yok saymak
- Farklı rank/hız DIMM karıştırmak
- ESD’siz reseat
- Ballooning / host swap’i fiziksel arıza sanmak
- Log almadan DIMM’leri rastgele yer değiştirmek
- Uncorrectable sonrası hemen cluster’a geri yüklemek (önce izole test)
Kontrol Listesi
- iDRAC/SEL’de slot ve severity not edildi.
- Correctable vs Uncorrectable ayrıldı.
- Maintenance penceresi planlandı.
- Reseat yapıldı.
- Slot ↔ DIMM swap izolasyonu tamamlandı.
- Uyumlu yedek DIMM hazır.
- RMA / Support case açıldı (gerekirse).
- Firmware/BIOS sürümü kayda geçti.
- 24–48 saat alert izleme.
- Runbook güncellendi (population şeması).
Leon-X ile Sonraki Adım
Leon-X, PowerEdge memory error teşhis ve DIMM RMA süreçlerini Sunucu Bakım, Garanti ve Teknik Destek kapsamında yönetir. Acil: İletişime Geçin.
Sık Sorulan Sorular
Correctable error sunucuyu düşürür mü?
Tek seferlik nadiren. Aynı DIMM’de sık tekrar Uncorrectable riskini artırır; planlı değişim yapın.
Tüm RAM’i değiştirmek gerekir mi?
Hayır. Önce hatalı slot/DIMM’i izole edin; matched set politikası varsa çift/kanal kuralına uyun.
Memtest şart mı?
Üretimde iDRAC log + izolasyon çoğu zaman yeter. Shop floor’da memtest ek kanıt sağlar.
ECC olmayan DIMM takılır mı?
Kurumsal PowerEdge için desteklenen ECC RDIMM/LRDIMM kullanın; non-ECC genelde POST fail veya destek dışı.
Memory error ile CPU error aynı mı?
Hayır. CPU/thermal ayrı aile; sonraki liste konusu CPU Error. Fan/PSU: Fan Error · PSU Failure.


