
فناوری DLSS 5 و قابلیت رندر عصبی (Neural Rendering) آن، از زمان معرفی تاکنون دو واکنش متضاد برانگیخته است: تحسین برای کیفیت تصویری که در بسیاری از بازیها تحولآفرین به نظر میرسد، و انتقادهایی درباره آنچه واقعاً در تصویر نهایی رخ میدهد. برای درک ریشهای این بحثها، مسیر متفاوتی طی شده است: بهجای اجرای بازی و آزمایش بصری، کد منبع یک پروژه متنباز بررسی شده که خط لوله رندر عصبی DLSS 5 را بازسازی میکند.
OpenDLSS-NR چیست و چه چیزی را بازسازی میکند؟
پروژه OpenDLSS-NR یک بازپیادهسازی متنباز از شبکه رندر عصبی DLSS 5 شرکت انویدیا است که بر پایه پژوهشهای مهندسی معکوس (Reverse Engineering) ساخته شده و هدف آن بازتولید رفتار رندر عصبی خارج از پشته نرمافزاری بسته انویدیا است. اجرای این پروژه به کارت گرافیکهای نسل Ada Lovelace یا بالاتر نیاز دارد؛ با این حال، حتی روی سیستمی مجهز به RTX 4070 Ti نیز نمیتوان آن را بهسادگی اجرا کرد، زیرا OpenDLSS-NR وزنهای شبکه (Weights) را همراه ندارد و کاربر باید خودش آنها را تأمین کند.
با این وجود، مطالعه کامل این کلون متنباز، دیدگاه روشنتری درباره بسیاری از «مشکلات» مطرحشده پیرامون DLSS 5 فراهم میکند.
هزینه واقعی عملکرد: رندر عصبی رایگان نیست
نخستین دلیل آنکه شکایتها از افت کارایی DLSS 5 هرگز فروکش نکرده، این است که رندر عصبی بههیچوجه بدون هزینه نیست. جدول بنچمارک این پروژه، این موضوع را بهروشنی نشان میدهد:
- روی کارت RTX 4070 SUPER، شبکه کامل رندر عصبی در رزولوشن 2160p (معادل 4K) به ۲۹.۳ میلیثانیه زمان نیاز دارد که در قالب ۲۴۱ ارسال به پردازنده گرافیکی (GPU Dispatch) انجام میشود.
- این عدد بهتنهایی معادل حدود ۳۴ فریم بر ثانیه صرفاً برای کار رندر عصبی است، پیش از آنکه بار خود بازی محاسبه شود.
- در رزولوشن 1440p نیز این شبکه همچنان به ۱۲.۶ میلیثانیه زمان نیاز دارد.
نویسندگان پروژه، شبکه را روی ۴۰ فریم اندازهگیری کرده و کمترین زمان را گزارش کردهاند؛ بار کاری 4K روی RTX 4070 SUPER در حدود ۱۳۳ ترافلاپس (TFLOPS) به محدودیت محاسباتی میرسد. این پیادهسازی در عمل سختافزار را تحت فشار قرار میدهد و صرفاً یک برآورد انتزاعی از هزینه نیست.
همین اعداد توضیح میدهند چرا انویدیا به یک کارت گرافیک کاملاً مجزا مانند RTX 5090 برای نمایش DLSS 5 نیاز داشت. در آزمایشهای عملی نیز استفاده از فایلهای DLL رسمی DLSS 5 در بازی The Blood of Dawnwalker بلافاصله نرخ فریم را به نصف کاهش داد و تنها با تغییر جایگاه لایه رندر عصبی در خط لوله پردازش، بخشی از کارایی بازگردانده شد.
آیا DLSS 5 واقعاً مانند یک «فیلتر هوش مصنوعی» عمل میکند؟
یکی از سادهترین راهها برای رد انتقادها، بیاعتبار دانستن مقایسه DLSS 5 با یک «فیلتر هوش مصنوعی» است؛ اما مشخصات خروجی OpenDLSS-NR نشان میدهد این مقایسه چندان بیپایه نیست. این شبکه فریم رندرشده را بهسادگی جایگزین نمیکند، بلکه یک باقیمانده (Residual) در فضای رنگ RGB تولید میکند که روی تصویر اصلی اعمال میشود.
این باقیمانده در واقع دستوری برای هر پیکسل است که تعیین میکند تصویر موجود چگونه تغییر کند. شبکه میتواند بخشهایی از رندر اصلی را تقریباً دستنخورده بگذارد و بخشهای دیگر را تغییر دهد؛ همین موضوع، نتیجه را از تیزکردن (Sharpening) یا بازسازی (Reconstruction) سنتی متمایز میکند. بازی پیشتر رندر خود را انجام داده و این شبکه رندر عصبی است که تصمیم میگیرد تصویر نهایی چه شکلی داشته باشد.
این کلون متنباز کنترلهای سبک (Style) نیز دارد. پارامتر سبک در OpenDLSS-NR بر ویژگیهایی مانند تُن، ساختار و پوست تأثیر میگذارد؛ یعنی شبکه تنها به بازیابی اطلاعات ازدسترفته رندرکننده بسنده نمیکند، بلکه ترجیحهای آموختهشدهای درباره ظاهر تصویر نهایی دارد.
بحث توهم جزئیات و نقش ورودی نویز
OpenDLSS-NR سه کانال «نویز گاوسی» (Gaussian Noise) را در کنار تصویر رندرشده و اطلاعات زمانی (Temporal Information) به شبکه تغذیه میکند. انویدیا DLSS 5 را یک مدل انتشار تکمرحلهای در فضای پیکسل (One-Step Pixel-Space Diffusion Model) توصیف میکند؛ یعنی نویز کنترلشده بخشی از فرایند تولید خروجی نهایی است.
همین موضوع، ترس از تولید جزئیات توهمی (Hallucinated Detail) را قابلدرکتر میکند. یک الگوریتم بازسازی متعارف تلاش میکند اطلاعات را از شواهد موجود در رندر بازیابی کند، اما یک مدل انتشار یاد گرفته است که اشیا معمولاً چگونه به نظر میرسند و میتواند ساختاری باورپذیر بسازد. DLSS 5 پیکسلها را بهصورت تصادفی اختراع نمیکند، اما تولید (Generation) بهمعنای واقعی کلمه بخشی از وظیفه آن است.
انویدیا پاسخی برای این نگرانی دارد: DLSS 5 بر پایه اطلاعات رندرکننده، بردارهای حرکت (Motion Vectors) و وضعیت زمانی شرطی میشود و در فرایند آموزش نیز از ویژگیهای صحنه برگرفته از رندرکننده استفاده میکند تا نتیجه تولیدشده به صحنه موردنظر توسعهدهنده وفادار بماند. این پاسخ اطمینانبخش است، اما این پرسش را باقی میگذارد که وقتی رندرکننده اصلی با دانش بصری آموختهشده شبکه اختلاف داشته باشد، حرف نهایی را کدامیک میزند.
نقطه کور بزرگ پروژه متنباز
یک انتقاد مهم به DLSS 5 را OpenDLSS-NR نتوانست روشن کند: اینکه مدل واقعاً چه چیزی یاد گرفته است. این پروژه معماری و پیادهسازی را در اختیار میگذارد، اما نه مجموعه داده آموزشی (Training Corpus) انویدیا را شامل میشود و نه فرایند تولید وزنهای شبکه را. میتوان بررسی کرد که این ماشین چگونه فکر میکند، اما نه آنکه چه چیزهایی به آن آموخته شده است.
اگر کسی نگران آن باشد که DLSS 5 مفروضات برگرفته از دادههای آموزشی خود را به تصاویر تولیدشده منتقل میکند، این مخزن نمیتواند آن نگرانی را تأیید یا رد کند. جالبترین شواهد در جایی قرار دارند که دسترسی به آن ممکن نیست و پاسخ پرسشهایی از جنس «چرا مدل چنین تصمیم خاصی را آموخته است؟» همچنان در اختیار انویدیا باقی میماند.
جمعبندی
مطالعه کامل این کلون متنباز، هاله رمزآلود پیرامون DLSS 5 را تا حد زیادی از میان برمیدارد؛ آنچه باقی میماند ورودیها، لایهها، وزنها، مصالحهها و حجم عظیمی از توان محاسباتی است که همگی برای تولید تصویری باورپذیر همکاری میکنند. با این حال، این بررسی نشان میدهد که فناوری رندر به نقطهای رسیده است که بهطور فزاینده تعیین میکند پیکسلهایی که پردازنده گرافیکی ترسیم میکند، باید چگونه به نظر برسند.