حریم خصوصی در پرامپت نویسی (Prompt Engineering Privacy) مجموعه‌ای از تکنیک‌های فنی و فرایندی است که برای حفاظت از داده‌های حساس کاربران در سامانه‌های مبتنی بر مدل‌های زبانی بزرگ (Large Language Models یا LLM) به کار می‌رود.
این تکنیک‌ها شامل ناشناس‌سازی داده، پاک‌سازی ورودی، رمزنگاری، محدودسازی دسترسی و طراحی معماری آگاه از حریم خصوصی است.
حفظ حریم خصوصی، یک الزام قانونی و اخلاقی است، نه یک ویژگی اختیاری.
رعایت اصول حریم خصوصی، اعتماد کاربران را افزایش می‌دهد.
این راهنما اصول، تکنیک‌ها و ملاحظات عملی حریم خصوصی در پرامپت نویسی را بررسی می‌کند.

حفظ حریم خصوصی در پرامپت نویسی، یکی از چالش‌های اساسی در طراحی سامانه‌های مبتنی بر مدل‌های زبانی است. برخلاف سامانه‌های سنتی که داده‌ها در یک پایگاه داده محصور می‌مانند، در سامانه‌های LLM، داده‌ها در قالب پرامپت به سرویس‌های بیرونی ارسال می‌شوند و همین ویژگی، ریسک‌های جدیدی ایجاد می‌کند. برای درک این چالش، ابتدا باید با پرامپت نویسی چیست و تزریق پرامپت آشنا باشیم.

در پروژه‌هایی که با داده‌های پزشکی یا مالی کار می‌کردیم، دیده‌ام که حریم خصوصی اغلب به یک نکته فرعی در طراحی معماری تقلیل می‌یابد. این در حالی است که یک اشتباه ساده، مانند ارسال داده خام مشتری در پرامپت، می‌تواند به نقض مقررات حفاظت از داده و از دست دادن اعتماد کاربر منجر شود. اگر با بهترین روش‌های امنیت پرامپت آشنا هستید، آماده‌اید تا به لایه حریم خصوصی وارد شوید.

حریم خصوصی در پرامپت نویسی را می‌توان با یک قفل مقایسه کرد: اگر کلید را در جای اشتباه بگذارید، هیچ قفلی نمی‌تواند از داده شما محافظت کند. در سامانه‌های LLM، این کلید همان پرامپت است؛ اگر داده حساس را در پرامپت قرار دهید، در معرض افشا قرار می‌گیرد. برای مطالعه بیشتر درباره اصول حریم خصوصی، می‌توانید صفحه Privacy را در ویکی‌پدیا ببینید.

حریم خصوصی در پرامپت نویسی چیست؟

حریم خصوصی در پرامپت نویسی، به مجموعه اقداماتی گفته می‌شود که برای حفاظت از داده‌های حساس کاربران در فرایند طراحی و اجرای پرامپت‌ها انجام می‌شود. این داده‌ها می‌توانند شامل اطلاعات شخصی، داده‌های مالی، داده‌های پزشکی یا اطلاعات محرمانه سازمانی باشند.

چالش اصلی این است که مدل‌های زبانی، به‌طور پیش‌فرض، داده‌ها را در قالب متن پردازش می‌کنند. اگر این داده‌ها حساس باشند، در معرض افشا قرار می‌گیرند. برای درک بهتر، پست نشت پرامپت را ببینید.

حریم خصوصی در مقابل امنیت

حریم خصوصی و امنیت، دو مفهوم نزدیک به هم هستند اما یک تفاوت اساسی دارند. امنیت، بر حفاظت از سامانه در برابر دسترسی غیرمجاز تمرکز دارد. حریم خصوصی، بر حفاظت از داده‌های شخصی در برابر استفاده یا افشای غیرمجاز تمرکز دارد. یک سامانه می‌تواند امن باشد اما حریم خصوصی کاربران را نقض کند.

حریم خصوصی به‌عنوان یک حق

در بسیاری از کشورها، حریم خصوصی به‌عنوان یک حق قانونی شناخته می‌شود. مقرراتی مانند GDPR در اروپا و CCPA در کالیفرنیا، چارچوب‌های قانونی برای حفاظت از حریم خصوصی ارائه می‌دهند. رعایت این مقررات، یک الزام قانونی است.

ریسک‌های حریم خصوصی در سامانه‌های LLM

ریسک‌های حریم خصوصی در سامانه‌های LLM متنوع هستند:

افشای داده در لاگ‌ها

در بسیاری از سامانه‌ها، پرامپت‌ها و پاسخ‌ها در لاگ‌ها ثبت می‌شوند. اگر این لاگ‌ها شامل داده حساس باشند، در معرض افشا قرار می‌گیرند.

نشت داده از طریق پرامپت

اگر داده حساس در پرامپت قرار گیرد، می‌تواند از طریق خروجی مدل افشا شود. این ریسک، در سامانه‌های چندکاربره بیشتر است.

استفاده داده برای آموزش مدل

در برخی سرویس‌های ابری، داده ارسالی می‌تواند برای آموزش مدل استفاده شود. این استفاده، می‌تواند به افشای غیرمستقیم داده منجر شود.

حمله استنتاج

مهاجم می‌تواند با استفاده از تکنیک‌های استنتاج، اطلاعات حساس را از خروجی مدل استخراج کند.

حمله عضویت

در این حمله، مهاجم تلاش می‌کند تعیین کند آیا یک داده خاص در مجموعه آموزش مدل وجود داشته است یا نه.

ریسکمنبعاثر
افشای داده در لاگثبت نادرستدسترسی غیرمجاز
نشت داده از پرامپتطراحی ضعیفافشای اطلاعات
استفاده برای آموزشسیاست سرویسافشای غیرمستقیم
حمله استنتاجخروجی مدلاستخراج داده
حمله عضویتمدل آموزش‌دیدهافشای حضور داده

در سامانه‌های LLM، داده حساس در پرامپت مانند پولی است که در خیابان رها شده باشد.

اصل حداقل‌سازی داده

اصل حداقل‌سازی داده (Data Minimization) یکی از اصول بنیادین حریم خصوصی است. بر اساس این اصل، سامانه باید فقط داده‌هایی را جمع‌آوری و پردازش کند که برای انجام وظیفه خود لازم است.

کاربرد در پرامپت نویسی

  • حذف داده‌های غیرضروری: قبل از ارسال پرامپت، داده‌های غیرضروری را حذف کنید.
  • استفاده از شناسه به‌جای نام: به‌جای نام مشتری، از یک شناسه استفاده کنید.
  • خلاصه‌سازی: به‌جای ارسال داده کامل، یک خلاصه ارسال کنید.
  • تعریف دامنه: دامنه داده‌های ارسالی را به حداقل لازم محدود کنید.

نمونه‌ای از حداقل‌سازی

پرامپت با داده حساس:

مشتری با نام احمد رضایی، کد ملی 1234567890، ساکن تهران،
درخواست بازگشت وجه دارد.

پرامپت با حداقل داده:

یک مشتری از تهران درخواست بازگشت وجه دارد.

در پرامپت دوم، داده‌های حساس حذف شده‌اند و فقط اطلاعات لازم برای پردازش باقی مانده است.

ناشناس‌سازی و شبه‌ناشناس‌سازی

ناشناس‌سازی (Anonymization) فرایندی است که در آن، داده‌های هویتی حذف یا جایگزین می‌شوند تا شناسایی فرد غیرممکن شود.

تفاوت ناشناس‌سازی و شبه‌ناشناس‌سازی

  • ناشناس‌سازی: داده‌های هویتی به‌طور کامل حذف می‌شوند و بازیابی آن‌ها ممکن نیست.
  • شبه‌ناشناس‌سازی: داده‌های هویتی با یک شناسه جایگزین می‌شوند که با استفاده از یک کلید، قابل بازیابی است.

تکنیک‌های ناشناس‌سازی

  • Generalization: تبدیل داده دقیق به یک محدوده (مثلاً تبدیل سن دقیق به گروه سنی).
  • Suppression: حذف کامل یک فیلد حساس.
  • Perturbation: تغییر جزئی داده به‌صورت تصادفی.
  • Tokenization: جایگزینی داده حساس با یک توکن.
  • Hashing: تبدیل داده به یک مقدار هش.

استفاده از Tokenization در پرامپت

در سامانه‌های پیشرفته، داده حساس قبل از ورود به پرامپت با یک توکن جایگزین می‌شود. سپس، پس از دریافت پاسخ مدل، توکن‌ها با داده‌های اصلی جایگزین می‌شوند. این رویکرد، به‌نام «Tokenization» شناخته می‌شود.

ماسک کردن داده حساس

ماسک کردن (Data Masking)، تکنیکی است که در آن، بخشی از داده حساس با کاراکترهای جایگزین نمایش داده می‌شود.

نمونه‌های ماسک کردن

  • شماره کارت: 1234-****-****-5678
  • شماره تلفن: 0912***4567
  • ایمیل: a***@example.com
  • کد ملی: 123****890

کاربرد در پرامپت نویسی

در پرامپت‌هایی که به داده حساس نیاز دارند، می‌توان از ماسک کردن استفاده کرد. این رویکرد، به مدل اجازه می‌دهد بر اساس بخش قابل‌مشاهده داده، پاسخ مناسب تولید کند، بدون آنکه داده حساس افشا شود.

رمزنگاری داده در پرامپت

رمزنگاری، یکی از قوی‌ترین ابزارهای حفاظت از حریم خصوصی است. در سامانه‌های LLM، رمزنگاری می‌تواند در چند لایه استفاده شود.

رمزنگاری در انتقال

داده‌های ارسالی به سرویس مدل، باید از طریق پروتکل‌های امن مانند HTTPS و TLS منتقل شوند.

رمزنگاری در ذخیره‌سازی

داده‌های ذخیره‌شده، باید رمزنگاری شوند. این رمزنگاری می‌تواند در سطح پایگاه داده یا در سطح فایل انجام شود.

رمزنگاری هم‌ریخت

رمزنگاری هم‌ریخت (Homomorphic Encryption) امکان محاسبه بر روی داده رمزنگاری‌شده را فراهم می‌کند. این تکنیک، در سامانه‌های LLM کاربرد محدودی دارد اما در حال توسعه است. برای جزئیات، پست رمزنگاری هم‌ریخت را ببینید.

Secure Multi-Party Computation

در این رویکرد، چند طرف می‌توانند بر روی داده مشترک محاسبه انجام دهند بدون آنکه داده خام را با یکدیگر به اشتراک بگذارند.

کنترل دسترسی به داده

کنترل دسترسی، یکی از اصول بنیادین حریم خصوصی است. در سامانه‌های LLM، این کنترل باید در چند لایه اعمال شود.

کنترل دسترسی در سطح کاربر

هر کاربر باید فقط به داده‌های خود یا داده‌هایی که مجاز است دسترسی داشته باشد.

کنترل دسترسی در سطح سرویس

سرویس‌های داخلی، باید فقط به داده‌هایی دسترسی داشته باشند که برای وظیفه خود لازم است.

کنترل دسترسی در سطح مدل

مدل باید فقط به داده‌هایی دسترسی داشته باشد که برای تولید پاسخ لازم است. این اصل، در سامانه‌های RAG حیاتی است. برای جزئیات، پست RAG چیست را ببینید.

Role-Based Access Control

در این رویکرد، دسترسی‌ها بر اساس نقش کاربر تعیین می‌شوند. برای جزئیات، پست مدیریت دسترسی‌های دیتابیس را ببینید.

معماری آگاه از حریم خصوصی

معماری آگاه از حریم خصوصی (Privacy-Aware Architecture)، رویکردی است که در آن، حریم خصوصی از ابتدای طراحی در معماری سامانه لحاظ می‌شود.

Privacy by Design

اصل Privacy by Design، بر این باور است که حریم خصوصی باید از ابتدای طراحی در سامانه لحاظ شود، نه به‌عنوان یک افزودنی بعدی.

Privacy by Default

اصل Privacy by Default، بر این باور است که سامانه باید به‌طور پیش‌فرض، حداکثر حفاظت از حریم خصوصی را فراهم کند.

Data Flow Mapping

برای طراحی معماری آگاه از حریم خصوصی، باید نقشه جریان داده (Data Flow Map) تهیه شود. این نقشه، مسیر حرکت داده در سامانه را نشان می‌دهد و نقاط ریسک را مشخص می‌کند.

جداسازی داده

داده‌های حساس باید از داده‌های غیرحساس جدا نگهداری شوند. این جداسازی، دسترسی غیرمجاز را دشوارتر می‌کند.

انطباق با مقررات

رعایت مقررات حریم خصوصی، یک الزام قانونی است. در سامانه‌های LLM، این رعایت باید در چند لایه لحاظ شود.

GDPR

مقررات عمومی حفاظت از داده اتحادیه اروپا (General Data Protection Regulation یا GDPR)، چارچوب قانونی برای حفاظت از داده‌های شخصی در اروپا است.

CCPA

قانون حریم خصوصی مصرف‌کننده کالیفرنیا (California Consumer Privacy Act یا CCPA)، چارچوب قانونی برای حفاظت از داده‌های مصرف‌کنندگان در کالیفرنیا است.

الزامات کلیدی

  • رضایت صریح: جمع‌آوری داده نیازمند رضایت صریح کاربر است.
  • حق دسترسی: کاربر حق دارد بداند چه داده‌ای از او جمع‌آوری شده است.
  • حق حذف: کاربر حق دارد درخواست حذف داده خود را بدهد.
  • حق انتقال: کاربر حق دارد داده خود را به سرویس دیگری منتقل کند.
  • اطلاع‌رسانی نقض: در صورت نقض داده، کاربران باید مطلع شوند.

حریم خصوصی در لاگ‌ها

لاگ‌ها، یکی از نقاط ریسک اصلی حریم خصوصی هستند. اگر لاگ‌ها شامل داده حساس باشند، در معرض افشا قرار می‌گیرند.

اصول حریم خصوصی در لاگ‌ها

  • حداقل‌سازی: فقط داده‌های لازم برای اشکال‌زدایی ثبت شوند.
  • ماسک کردن: داده‌های حساس ماسک شوند.
  • دوره نگهداری: دوره نگهداری لاگ‌ها محدود باشد.
  • دسترسی محدود: فقط افراد مجاز به لاگ‌ها دسترسی داشته باشند.
  • رمزنگاری: لاگ‌ها در حالت ذخیره رمزنگاری شوند.

نمونه‌ای از لاگ امن

[2025-01-15 14:30:22] User: user_12345 (hashed),
Action: payment_request, Amount: 500000,
Status: success

در این لاگ، شناسه کاربر با هش جایگزین شده و داده‌های حساس دیگر ثبت نشده‌اند.

پرسش‌های پرتکرار درباره حریم خصوصی پرامپت

آیا استفاده از سرویس‌های ابری LLM حریم خصوصی را نقض می‌کند؟

بستگی به سیاست سرویس دارد. برخی سرویس‌ها داده ارسالی را برای آموزش مدل استفاده می‌کنند، برخی دیگر این کار را نمی‌کنند. قبل از استفاده، سیاست سرویس را بررسی کنید.

آیا ناشناس‌سازی داده کافی است؟

نه همیشه. در برخی موارد، داده‌های ناشناس‌شده می‌توانند با ترکیب با داده‌های دیگر، دوباره قابل شناسایی شوند. این پدیده، Re-identification نامیده می‌شود.

آیا رمزنگاری می‌تواند از افشای داده جلوگیری کند؟

بله، اما فقط اگر داده در همه مراحل (انتقال، ذخیره‌سازی و پردازش) رمزنگاری شود. اگر مدل به داده رمزگشایی‌شده دسترسی داشته باشد، افشا ممکن است.

آیا استفاده از مدل‌های محلی حریم خصوصی را تضمین می‌کند؟

مدل‌های محلی، ریسک افشا در سرویس ابری را حذف می‌کنند، اما ریسک‌های دیگر مانند افشا در لاگ‌ها را از بین نمی‌برند.

آیا حریم خصوصی با امنیت یکی است؟

خیر. امنیت بر حفاظت از سامانه در برابر دسترسی غیرمجاز تمرکز دارد، در حالی که حریم خصوصی بر حفاظت از داده‌های شخصی تمرکز دارد.

چطور بفهمم سامانه‌ام حریم خصوصی را رعایت می‌کند؟

سه رویکرد: تحلیل معماری، بررسی لاگ‌ها و ممیزی حریم خصوصی. برای جزئیات، پست مانیتورینگ پرامپت را ببینید.

آیا GDPR بر سامانه‌های LLM اعمال می‌شود؟

بله، اگر سامانه شما داده‌های شهروندان اتحادیه اروپا را پردازش می‌کند، GDPR اعمال می‌شود.

آیا حریم خصوصی بر هزینه اجرا اثر دارد؟

بله. تکنیک‌های حریم خصوصی مانند رمزنگاری و ناشناس‌سازی، هزینه و پیچیدگی را افزایش می‌دهند.

آیا می‌توان از یک مدل برای حفاظت از حریم خصوصی مدل دیگر استفاده کرد؟

بله. مدل‌های نگهبان می‌توانند برای شناسایی داده حساس در پرامپت و خروجی استفاده شوند.

آیا حریم خصوصی در پرامپت نویسی بر عملکرد مدل اثر دارد؟

در برخی موارد، بله. ناشناس‌سازی داده می‌تواند دقت مدل را کاهش دهد. بنابراین، باید بین حریم خصوصی و دقت تعادل برقرار کرد.

چطور تیم خود را برای رعایت حریم خصوصی آموزش دهیم؟

با آموزش مفاهیم پایه، تمرین‌های عملی و بازبینی منظم حوادث.

نتیجه‌گیری کاربردی

حفظ حریم خصوصی در پرامپت نویسی، یک الزام قانونی و اخلاقی است که نیازمند ترکیبی از تکنیک‌های فنی و فرایندی است. این تکنیک‌ها شامل حداقل‌سازی داده، ناشناس‌سازی، ماسک کردن، رمزنگاری، کنترل دسترسی و طراحی معماری آگاه از حریم خصوصی است. رعایت این اصول، اعتماد کاربران را افزایش می‌دهد و ریسک نقض مقررات را کاهش می‌دهد.

در سامانه‌های LLM، حریم خصوصی نه یک ویژگی اختیاری، بلکه یک الزام بنیادین است که باید از ابتدای طراحی لحاظ شود.

در پروژه‌هایی که با داده‌های حساس کار می‌کردیم، رعایت اصول حریم خصوصی ابزار اصلی برای حفظ اعتماد کاربران بوده است. توصیه می‌کنم حریم خصوصی را به‌عنوان بخشی از چرخه توسعه در نظر بگیرید و از یک چارچوب حاکمیتی مشخص استفاده کنید. اگر تجربه‌ای در پیاده‌سازی این اصول در پروژه‌های واقعی دارید، تجربه خودتان را با ما به اشتراک بگذارید.