Що таке дедуплікація даних у бекапах і як вона економить місце?
Дедуплікація даних є інтелектуальним методом оптимізації зберігання, який виключає дублювання повторюваних фрагментів інформації в резервних копіях. Якщо в компанії створюються бекапи з десятків робочих станцій, на них міститься безліч ідентичних системних файлів і офісних додатків, і дедуплікація записує кожну унікальну послідовність байтів лише один раз.
Технологія працює на рівні блоків або файлів, аналізуючи вхідний потік даних і створюючи унікальні математичні хеш-суми для кожного фрагмента. Коли система бекапу зустрічає блок із уже наявним хешем, вона не створює новий запис на диску, а просто ставить внутрішнє посилання на вже збережений оригінал.
Такий підхід дозволяє домогтися колосальної економії дискового простору, часто зменшуючи необхідний обсяг сховища в п'ять або навіть десять разів порівняно з вихідним розміром даних. Це робить довгострокове зберігання архівів фінансово доступним і знижує навантаження на канали зв'язку при передачі копій.
Проте у дедуплікації є свої особливості, які потрібно враховувати при проектуванні інфраструктури. Процес аналізу та пошуку дублікатів вимагає значних обчислювальних ресурсів процесора й оперативної пам'яті, тому для систем із високою дедуплікацією критично важлива продуктивність апаратного забезпечення.