یک انسان به احتمال زیاد می تواند تفاوت یک لاک پشت و تفنگ را بیان کند. دو سال پیش ، هوش مصنوعی گوگل چندان مطمئن نبود. مدتی است که زیر مجموعه ای از تحقیقات علوم رایانه به درک بهتر چگونگی برخورد مدل های یادگیری ماشین با این حملات "دشمن" ، که ورودی هایی هستند که عمدا برای ترفند یا فریب الگوریتم های یادگیری ماشین اختصاص داده شده اند اختصاص داده شده است.
در حالی که بیشتر این کار بر روی گفتار و تصاویر متمرکز شده است ، اخیراً تیمی از آزمایشگاه علوم کامپیوتر و هوش مصنوعی MIT مرزهای متن را آزمایش کردند . آنها با "TextFooler" ، چارچوبی کلی را ارائه دادند که می تواند با موفقیت به سیستم های پردازش زبان طبیعی (NLP) حمله کند - انواع سیستم هایی که به ما اجازه می دهند تا با دستیاران صوتی و Siri و الکسا در تعامل باشیم - و آنها را در پیش بینی اشتباه پیش بینی کنیم.
می توان تصور کرد که از TextFooler برای بسیاری از برنامه های مرتبط با ایمنی اینترنت استفاده کنید ، مانند فیلتر کردن اسپم ایمیل ، پرچم گذاری متن سخن گفتن متنفر ، یا تشخیص متن گفتار سیاسی "حساس" که همگی مبتنی بر مدل های طبقه بندی متن هستند.
دی جین ، دکتری MIT می گوید: "اگر این ابزارها در برابر حمله دشمنان هدفمند آسیب پذیر باشند ، ممکن است عواقب آن فاجعه بار باشد." دانش آموز و نویسنده اصلی در مقاله جدید در مورد TextFooler. "این ابزارها برای محافظت از خود باید رویکردهای دفاعی موثری داشته باشند و برای ایجاد چنین سیستم دفاعی ایمن ، ابتدا باید روشهای متضاد را بررسی کنیم."
TextFooler در دو بخش کار می کند: تغییر یک متن معین ، و سپس با استفاده از آن متن برای تست دو کار مختلف زبان برای دیدن اینکه آیا این سیستم می تواند با موفقیت مدل های یادگیری ماشین را فریب دهد یا خیر.
سیستم ابتدا مهمترین کلماتی را که بر پیش بینی مدل هدف تأثیر می گذارد ، شناسایی می کند و سپس مترادف های متناسب را با هم انتخاب می کند. این همه در حالی است که دستور زبان و معنای اصلی را حفظ می کنیم تا به اندازه کافی "انسانی" به نظر برسد ، و تا زمانی که پیش بینی تغییر نکند.
سپس ، چهارچوب برای دو کار متفاوت - طبقه بندی متن ، و دعوت نامه (که ارتباط بین قطعات متن در یک جمله است) است ، با هدف تغییر طبقه بندی یا بی اعتبار کردن داوری مربوط به مدلهای اصلی.
در یک مثال ، ورودی و خروجی TextFooler عبارت بودند از:
"شخصیت های بازیگر در موقعیت های غیرقابل تصور ، کاملاً از واقعیت خارج می شوند."
"شخصیت ها ، که در شرایط غیرممکن مهندسی شده اند ، کاملاً از واقعیت خارج می شوند."
در این حالت ، هنگام آزمایش بر روی یک مدل NLP ، ورودی ورودی نمونه را به درستی دریافت می کنید ، اما سپس ورودی اصلاح شده را اشتباه می گیرید.
در کل ، TextFooler با موفقیت به سه مدل هدف حمله کرد ، از جمله "BERT" ، مدل محبوب NLP با منبع باز. این مدل های هدف را با دقت بیش از 90 درصد به زیر 20 درصد فریب داد ، با تغییر تنها 10 درصد کلمات در متن معین. تیم موفقیت ارزیابی در سه معیار: تغییر مدل را پیش بینی برای طبقه بندی و یا استلزام، اگر به آن نگاه کرد در این معنی در مقایسه با به عنوان مثال اصلی به یک انسان خواننده مشابه، و در نهایت در صورتی که متن نگاه طبیعی به اندازه کافی.
محققان خاطرنشان كردند: اگرچه حمله به مدلهای موجود هدف نهایی نیست ، آنها امیدوارند كه این كار به مدلهای انتزاعی تر جهت تعمیم داده های جدید و غیب یاری كند.
جین می گوید: "این سیستم برای حمله به هر مدل NLP مبتنی بر طبقه بندی می تواند مورد استفاده قرار گیرد یا از آن استفاده کند." "از طرف دیگر ، از طرفداران ایجاد شده می توان برای تقویت استحکام و تعمیم الگوهای یادگیری عمیق از طریق آموزش مخالف استفاده کرد که یک جهت مهم در این کار است."
http://prbookmarkingwebsites.com/story4993207/پمپ-وکیوم-آبی