
بسیاری از کاربران از دستگاه ذخیرهسازی متصل به شبکه (NAS) برای نگهداری فایلها و پشتیبانگیری خودکار استفاده میکنند و چون این فرایندها بهصورت زمانبندیشده اجرا میشوند، دیگر نیازی به کپی دستی دادهها احساس نمیشود. با این حال، پشتیبانگیری خودکار نیز از بازبینی دورهای بینیاز نیست؛ بهویژه زمانی که فایلها جابهجا شدهاند یا پوشههایی به فهرست پشتیبان اضافه شدهاند که بخشی از دادههای یکسان را در خود دارند. در یک تجربه عملی، یک ایجنت کدنویسی (Coding Agent) مبتنی بر هوش مصنوعی برای بازرسی NAS به کار گرفته شد و توانست ۲ ترابایت فایل تکراری را شناسایی کند که هزینه نگهداری آنها دو بار پرداخت میشد.
پشتیبانگیری خودکار هم به توجه کاربر نیاز دارد
هنگام تنظیم یک کار پشتیبانگیری (Backup Job)، کاربر پوشههای موردنظر را انتخاب میکند و اجرای آن را به یک زمانبند میسپارد. چند ماه بعد، همان پوشهها ممکن است حاوی فایلهای بیاستفاده، خروجیهای قدیمی یا نسخههایی از دادههایی باشند که پیشتر در جای دیگری ذخیره شدهاند. کار پشتیبانگیری همچنان هر چیزی را که در محدوده تعریفشده قرار بگیرد ذخیره میکند و بررسی موفقیتآمیز بودن اجرای آن، به این پرسش پاسخ نمیدهد که آیا همه آن دادهها هنوز باید در چرخه پشتیبانگیری باقی بمانند یا نه.
مشکل دیگری که رخ میدهد، پشتیبانگیری از فایلهای یکسان از مسیرهای متفاوت است. برای نمونه، اگر عکسهای یک پشتیبان لپتاپ را به کتابخانه تصاویر جداگانهای منتقل کنید، دو مکان خواهید داشت که تصاویر یکسانی را در خود جای دادهاند؛ در صورت قرار گرفتن هر دو مسیر در برنامه پشتیبانگیری، هر دو نسخه حفظ میشوند. کارهای پشتیبانگیری همپوشان (Overlapping Backup Jobs) نیز مشکلساز است؛ کاری که یک پوشه کامل را پوشش میدهد، ممکن است زیرپوشهای را نیز در بر بگیرد که برای آن کار پشتیبانگیری دومی تعریف شده است.
چرا محل قرارگیری فایل تکراری اهمیت دارد
هدف از این بازرسی، بررسی همزمان فایلها و ساختار پشتیبانگیری بود، زیرا محل قرارگیری نسخه تکراری اهمیت تعیینکنندهای دارد. یک فایل کاری و نسخه پشتیبان آن طبیعتاً محتوای یکسانی دارند و این تکرار طبیعی است؛ اما دو نسخه اضافی در پوشههایی که هر دو پشتیبانگیری میشوند، باید دقیقتر بررسی شوند. اگر برای فضای ذخیرهسازی پشتیبان هزینه پرداخت میکنید، این نسخههای اضافی در حجم ذخیرهشده شما محاسبه میشوند؛ هرچند فشردهسازی (Compression) و حذف دادههای تکراری (Deduplication) بر میزان فضای اضافی مصرفشده اثر میگذارند.
دادن دسترسی SSH به ایجنت هوش مصنوعی
در این تجربه، ابتدا قابلیت SSH روی دستگاه NAS فعال شد تا امکان اتصال از رایانهای دیگر و اجرای فرمانها روی آن فراهم شود. رابط کاربری تولیدکنندگان مختلف NAS با یکدیگر تفاوت دارد، اما تنظیمات موردنیاز در همه آنها یکی است. علاوه بر این، به نشانی IP دستگاه NAS و حسابی نیاز است که اجازه خواندن پوشههای مورد بازرسی را داشته باشد.
ایجنت کدنویسی روی یک رایانه مک اجرا شد و از طریق همان اتصال به NAS دسترسی گرفت. کاربر میتواند اتصال SSH را خودش در ترمینال (Terminal) با فرمان ssh username@NAS_IP آزمایش کند و در صورت درخواست، گذرواژه را وارد کند. پس از برقراری این اتصال، ایجنت میتواند با استفاده از SSH پوشهها را بررسی کرده و یک اسکنر فایلهای تکراری (Duplicate Scanner) را روی NAS اجرا کند.
نکته کلیدی، ارائه دستورهایی به ایجنت است که مشخص کند کدام پوشهها باید بررسی شوند، محتوای فایلها با یکدیگر مقایسه شود و پیکربندی موجود پشتیبانگیری نیز مورد ارزیابی قرار گیرد. همچنین باید از ایجنت خواست گزارش دهد که داده یکسان در کجا بیش از یک بار ظاهر شده است. اگر تنظیمات پشتیبانگیری از طریق SSH قابل دسترسی نیست، میتوان یک فایل خروجی از پیکربندی در اختیار ایجنت گذاشت یا مبدأ و مقصد هر کار پشتیبانگیری را برای آن توصیف کرد تا بتواند نسخههای تکراری را از فایلهایی که آگاهانه بهعنوان پشتیبان نگهداری میشوند، تفکیک کند.
دستورهای لازم برای یک بازرسی بیخطر
- درخواست صریح گزارش بدون حذف، جابهجایی یا تغییر هیچ فایلی
- درخواست مسیر کامل فایلها و حجم هر گروه از فایلهای تکراری
- درخواست توضیح درباره دلیل نیاز هر گروه به بازبینی
- محدود کردن همزمانی پردازش (Concurrency) به دلیل فعالیت سنگین دیسک در اسکن چند ترابایت داده
- ثبت فایلهایی که قابل خواندن نیستند یا در میانه اسکن تغییر میکنند
نتیجه بازرسی: ۲ ترابایت داده تکراری
ایجنت کدنویسی ۲ ترابایت فایل تکراری را شناسایی کرد که دو بار پشتیبانگیری میشدند. در این مورد خاص، فایلهای حجیم فتوشاپ و ویدیوها فضای بیشتری از هزاران سند کوچک اشغال میکردند و همین یافتهها ارزش عملی بالایی داشتند. پروژههای فتوشاپ بهراحتی محل تجمع نسخههای تکراری میشوند؛ یک فایل PSD میتواند هم در پوشه کاری، هم در آرشیو پروژه تکمیلشده و هم در پوشهای که برای تحویل آماده شده است وجود داشته باشد و اگر هر سه مسیر در پشتیبانگیری گنجانده شوند، یک فایل چند بار ذخیره میشود.
در این بازرسی، دو فایل ویدیویی نیز پیدا شد که نامهای متفاوت اما محتوای کاملاً یکسانی داشتند؛ چنین تکراری با جستوجوی نامهای تکراری قابل شناسایی نیست. تغییر نام یک ویدیو برای سازماندهی بهتر، محتوای آن را تغییر نمیدهد و نگه داشتن نسخه اصلی در جای دیگر، یک کپی کامل دیگر به وجود میآورد. در فایلهای ویدیویی حجیم، حتی تعداد اندکی نسخه تکراری میتواند فضای قابل توجهی را اشغال کند.
محل قرارگیری پوشهها نیز توضیح میدهد که چگونه این نسخهها دو بار پشتیبانگیری میشوند؛ برای مثال، میتوان یک پروژه تمامشده را روی NAS آرشیو کرد و همان فایلها را در پوشهای روی لپتاپ نگه داشت که جداگانه پشتیبانگیری میشود. در این حالت، آرشیو و پشتیبان لپتاپ حاوی فایلهای پروژه یکسانی خواهند بود. این وضعیت میتواند آگاهانه باشد، اما اگر تنها به دلیل فراموش کردن یکی از آنها حفظ شده باشد، نیازمند بازبینی است.
کدام نسخهها را نگه داریم؟
نتایج این بازرسی برای بررسی بزرگترین گروههای تکراری، انتخاب نسخه مبدأیی که باید حفظ شود و اطمینان از پوشش پشتیبانگیری آن به کار میرود. پیش از حذف هر فایل، باید اطمینان حاصل کرد که امکان بازیابی فایلهای نگهداشتهشده وجود دارد. پس از آن میتوان کارهای پشتیبانگیری همپوشان را بهروزرسانی کرد تا از حفظ نسخههای غیرضروری جلوگیری شود.