Защо SSD дисковете умират внезапно (и как да се справим с това)

SSD дисковете са много по-бързи от традиционните HDD, но това не означава, че са вечни. Те също имат ограничен ресурс и могат да се повредят внезапно – понякога дори без предварителни предупреждения.

NAND Flash паметта, използвана в съвременните SSD, не може да съхранява информацията безкрайно. Способността на клетките да задържат електрическия заряд зависи от температурата, типа памет, степента на износване на диска и редица други фактори.

Стандартът JEDEC JESD218 определя конкретни условия за оценка на data retention при изключено SSD. За клиентски SSD е посочен сценарий с 30 °C и период от 1 година, докато за enterprise SSD – 40 °C и период от 3 месеца.

Тези стойности не трябва да се разглеждат като универсален срок, след който SSD автоматично губи данните си, а като резултат от изпитване при конкретна комбинация от температура и степен на износване. Реалният период на запазване на информацията може да бъде различен в зависимост от конкретната NAND технология, използваното SSD и условията на съхранение, както и от архитектурата и алгоритмите на конкретния SSD контролер – включително over-provisioning, wear leveling, write amplification и механизмите за корекция на грешки (ECC).

Тези механизми не променят директно физическото задържане на заряда в NAND клетките, но влияят върху начина, по който паметта се износва и върху способността на SSD да открива и коригира грешки при постепенното влошаване на клетките.

Производителите на съвременни SSD посочват конкретна TBW стойност за даден модел, която представлява общото количество данни, записано от хоста, при което устройството трябва да изпълнява определени изисквания за издръжливост. Това често създава погрешното впечатление, че една NAND клетка издържа определен брой цикли и че дискът ще оцелее след определен брой пълни презаписи независимо от характера на натоварването. Реалността обаче е значително по-нюансирана.

Към 2026 г. основните типове NAND памет и типичните им характеристики са:

Тип памет Бита на клетка Типични P/E цикли (raw) Ориентировъчен TBW за 1 TB потребителски SSD Основна употреба
SLC 1 50 000-100 000 - Индустриални/критични приложения
MLC 2 3 000-10 000 ~800 - 1 200 TBW при висок клас/по-стари MLC модели Специализирани/enterprise (все по-рядко в потребителски)
TLC 3 1 000-3 000 (модерни 3D често в горния край) ~600 - 1 000 TBW (често около 600+) Основен избор за повечето потребителски и много enterprise SSD
QLC 4 100-1 000 ~200 - 400 TBW Бюджетни и висококапацитетни дискове, read-heavy натоварвания
PLC 5 Не трябва да се посочва фиксирано число Липсва достоверна информация Експериментални/висококапацитетни решения

Модерните 3D TLC и подобрените QLC (с по-голям брой слоеве, по-добър контролер и firmware) значително подобряват реалната издръжливост спрямо по-старите поколения. Въпреки това TBW рейтингите на производителите отразяват сценарии с равномерно натоварване и добър wear leveling. Реалното износване зависи силно от типа натоварване, температурата, write amplification и качеството на самата памет.

Реалността за издръжливостта на TLC и другите типове NAND памет

SSD дисковете използват NAND Flash памет, при която всяка клетка може да бъде програмирана и изтривана ограничен брой пъти. Този процес постепенно износва клетката и с увеличаването на броя цикли Program/Erase (P/E) способността ѝ надеждно да задържа и различава електрическия заряд се влошава.

При TLC (Triple-Level Cell) във всяка NAND клетка се съхраняват 3 бита информация.  Тя трябва да различава 8 различни състояния на електрическия заряд, защото 3 бита могат да образуват 23 = 8 различни комбинации:


Всяко от тези състояния съответства на определен диапазон на електрическия заряд в клетката. Контролерът на SSD използва прецизно измерване на този заряд, за да определи кое от състоянията е било записано.

С течение на времето и след многократни P/E цикли изолационният слой на NAND клетката се износва. Това води до по-трудно контролиране и задържане на заряда и до увеличаване на вероятността клетката да бъде отчетена неправилно. Затова производителите използват технологии като ECC (Error-Correcting Code), различни алгоритми за управление на NAND паметта, резервни блокове и други механизми за компенсиране на постепенното износване.

Важно е да се уточни, че не съществува универсален брой P/E цикли, валиден за всяка NAND памет. Издръжливостта зависи от конкретното поколение NAND, технологията на производство, качеството на паметта, условията на работа и начина, по който SSD контролерът управлява записите.

Какво се случва с данните след износване?

При нормално работеща клетка контролерът може надеждно да различи възможните състояния на заряда. С увеличаването на броя P/E цикли обаче границите между тези състояния стават все по-трудни за разграничаване. Зарядът в клетката може да се промени с времето и това увеличава вероятността от грешки при прочитане, но контролерът използва прагови нива и алгоритми за корекция на грешки, за да определи първоначално записаното състояние.

Това е особено важно при изключено SSD. След като устройството бъде изключено, клетките трябва да запазят достатъчно точно своя заряд, за да може информацията да бъде възстановена при следващо включване. Колкото по-износена е NAND паметта, толкова по-малък може да бъде запасът между нормалното състояние на клетката и границата, при която контролерът вече не може надеждно да определи записаната стойност.

Колко дълго SSD съхранява данните, когато е изключен?

Способността на клетките да задържат заряда си зависи от температурата, типа NAND, степента на износване и времето, през което SSD остава без захранване. С увеличаването на броя Program/Erase (P/E) цикли клетките постепенно се износват и способността им надеждно да задържат и разграничават различните нива на електрически заряд се влошава. Повишаването на температурата допълнително ускорява тези процеси, поради което силно износено SSD, оставено изключено при висока температура, може да загуби надеждността на съхранените данни значително по-бързо от ново или слабо използвано устройство.

Затова при дългосрочно съхранение на SSD е важно да се отчита не само неговият капацитет и номинална издръжливост, но и степента на износване, температурата и времето, през което устройството остава без захранване.

Какво се случва с „второкачествените“ чипове

Чиповете, които не преминават строгите изисквания на големите NAND производители, не остават без приложение. По-малки и бюджетни производители (Kingspec, Smartbuy и подобни) често купуват такива чипове на едро и произвеждат нискобюджетни SSD с компромисна надеждност. Други подходи включват увеличаване на резервните блокове (и продаване на диск с по-нисък обявен капацитет, напр. 480 GB вместо 512 GB) или използване на TLC чипове в MLC режим (практика, прилагана от някои производители като Crucial/Micron в определени модели), което значително повишава надеждността за сметка на капацитета.

Защо SSD дисковете отказват без SMART грешки

Производителите дават издръжливост от стотици или хиляди TBW, но това не гарантира, че SSD ще работи безпроблемно до достигането на тази стойност. TBW е номинален показател за издръжливостта на конкретния модел и не представлява гарантиран срок на експлоатация. В практиката SSD може да откаже и при значително по-нисък записан обем.

SMART може да показва нормални стойности, а SSD да откаже внезапно. Показателят за оставащ ресурс обикновено е агрегирана оценка на износването на NAND паметта, а не пълна проверка на всички критични компоненти и служебни структури на SSD. Следователно стойност като 98% Remaining Life не означава, че всеки вътрешен компонент на SSD има още 98% надежден ресурс.

Причината е, че SMART не представлява пълна диагностика на вътрешната архитектура на SSD. Контролерът използва служебни данни, съхранявани в NAND, включително firmware, таблици за преобразуване на логически към физически адреси и други метаданни, необходими за нормалната работа на устройството. Начинът, по който тези структури се съхраняват, дублират, обновяват и защитават, зависи от конкретния контролер и firmware.

При интензивни натоварвания множество малки записи могат да увеличат write amplification и съответно да ускорят износването на NAND. Това износване не означава непременно, че SMART ще отчете предварително проблем с конкретна служебна структура или друг критичен компонент.

Ако критична вътрешна структура стане нечитаема и наличните механизми за корекция или възстановяване не успеят да компенсират грешките, SSD може да не успее да се инициализира нормално. В зависимост от конкретния контролер и характера на повредата устройството може да изчезне от BIOS, да се разпознава с неправилен или нулев капацитет, да се появи като RAW/неинициализиран носител или да влиза в цикъл на неуспешна инициализация.

При такъв отказ проблемът вече не е просто повредена файлова система. Необходимо е да се възстанови достъпът до самата NAND памет и да се възстановят или реконструират данните според вътрешната архитектура на SSD. В този случай стандартните софтуерни инструменти за възстановяване на данни не могат да помогнат.

Възстановяване на данни чрез Factory Access Mode

Дори когато SSD дискът вече не се появява в операционната система, разпознава се като RAW носител или показва неправилен капацитет, самите потребителски данни може все още да се намират в NAND чиповете. Проблемът може да е в контролера, firmware-а или служебните структури, необходими за достъп до тях.

При такива случаи стандартните програми за възстановяване на данни обикновено не са достатъчни. Необходимо е специализирано оборудване и достъп до сервизните функции на конкретния SSD контролер. В зависимост от модела и повредата могат да бъдат възстановени или реконструирани необходимите служебни структури и да се получи достъп до NAND паметта, след което данните се извличат и реконструират.

Ако SSD съдържа важна информация, не го инициализирайте, не го форматирайте и не опитвайте многократни софтуерни ремонти. Допълнителните записи могат да усложнят възстановяването. При сериозен хардуерен или firmware проблем най-важната стъпка е първо да се запази състоянието на носителя и да се направи професионална диагностика.

В DataRecovery.BG извършваме възстановяване на данни от отказали SSD дискове, включително при случаи, в които устройството не се разпознава нормално, показва неправилен капацитет или е престанало да работи внезапно, въпреки нормалните SMART показатели.