دوشنبه ۲۶ مرداد ۱۴۰۵ , 17 Aug 2026
جالب است ۰
پژوهشگران از زنجیره‌ای از حملات علیه عامل‌های هوش مصنوعی اندروید پرده برداشتند که از نمایش متن‌های نامرئی روی صفحه‌نمایش آغاز شده و به اجرای دستورات روی رایانه‌ای که گوشی را کنترل می‌کند، منجر شود.
منبع : the hacker news
پژوهشگران از زنجیره‌ای از حملات علیه عامل‌های هوش مصنوعی اندروید پرده برداشتند که از نمایش متن‌های نامرئی روی صفحه‌نمایش آغاز شده و به اجرای دستورات روی رایانه‌ای که گوشی را کنترل می‌کند، منجر شود.
 
به گزارش افتانا،  پژوهشگران امنیت سایبری از شناسایی مجموعه‌ای از آسیب‌پذیری‌ها در عامل‌های هوش مصنوعی متن‌باز اندروید خبر داده‌اند؛ ضعف‌هایی که می‌توانند از نمایش متن‌های تقریباً نامرئی روی صفحه‌نمایش آغاز شوند و در نهایت به اجرای دستورات روی رایانه‌ای منجر شوند که گوشی را از طریق ADB کنترل می‌کند. به گفته محققان، یک اپلیکیشن اندرویدی که امکان نمایش لایه (Overlay) روی سایر برنامه‌ها و دسترسی به فضای ذخیره‌سازی مشترک را داشته باشد، می‌تواند دستوراتی را روی صفحه نمایش دهد که برای کاربر قابل مشاهده نیستند، اما عامل هوش مصنوعی آن‌ها را از روی اسکرین‌شات می‌خواند، بخشی از رابط کاربری واقعی تصور می‌کند و بر همان اساس اقدام بعدی خود را انجام می‌دهد.
 
این پژوهش هفت سناریوی حمله را علیه پنج چارچوب متن‌باز شامل AppAgent، AppAgentX، Mobile-Agent-v3، Open-AutoGLM و MobA بررسی کرده و نشان می‌دهد هر پنج پروژه دست‌کم در برابر شش مورد از این هفت حمله آسیب‌پذیر هستند. مقاله این تحقیق نخستین بار اول ژوئیه در arXiv منتشر شد و نسخه بازنگری‌شده آن نیز ۱۴ ژوئیه انتشار یافت. این پژوهش حاصل همکاری محققانی از دانشگاه Simon Fraser، دانشگاه چینی هنگ‌کنگ، دانشگاه شاندونگ و آزمایشگاه Xingtu وابسته به شرکت امنیتی QAX است.
 
به گفته پژوهشگران، تاکنون هیچ مدرکی از سوءاستفاده از این روش‌ها در دنیای واقعی مشاهده نشده و همه آزمایش‌ها در محیطی کنترل‌شده انجام شده‌اند. همچنین هنوز هیچ شناسه CVE برای این آسیب‌پذیری‌ها اختصاص نیافته است. با این حال، بررسی The Hacker News نشان می‌دهد کدهای آسیب‌پذیر توصیف‌شده در مقاله تا ۱۷ ژوئیه همچنان در شاخه اصلی هر پنج پروژه وجود داشته‌اند. نویسندگان مقاله نیز می‌گویند پیش از انتشار عمومی نتایج، این مشکلات را به‌صورت محرمانه به توسعه‌دهندگان گزارش کرده‌اند، اما تاکنون پاسخی دریافت نکرده‌اند.
 
یکی از مهم‌ترین آسیب‌پذیری‌های کشف‌شده به نحوه ساخت دستورات ADB مربوط می‌شود. در پروژه AppAgent، متنی که مدل هوش مصنوعی از روی صفحه می‌خواند، تقریباً بدون هیچ پاک‌سازی مؤثری مستقیماً وارد دستور adb shell input text می‌شود. نسخه فعلی این پروژه تنها فاصله‌ها و علامت نقل‌قول تکی را حذف می‌کند، اما کاراکترهایی مانند ;، & و > همچنان بدون فیلتر باقی می‌مانند. در نتیجه اگر مدل چنین رشته‌ای را از روی صفحه بخواند، پوسته سیستم‌عامل آن را به‌عنوان بخشی از یک فرمان جدید تفسیر می‌کند و ادامه دستور روی رایانه میزبان اجرا می‌شود.
 
برای اثبات این موضوع، پژوهشگران رشته‌ای طراحی کردند که باعث اجرای برنامه Calculator ویندوز شد. این حمله در پروژه‌های AppAgent، AppAgentX، Mobile-Agent-v3 و MobA در هر ۲۰ آزمایش با موفقیت انجام شد. در آزمایش دیگری نیز رشته‌ای مانند test;pwd>rce_success باعث شد مسیر کاری رایانه میزبان در یک فایل ذخیره شود؛ نتیجه‌ای که نشان می‌دهد مهاجم می‌تواند از طریق گوشی، دستورات دلخواه خود را روی رایانه‌ای که عامل هوش مصنوعی را اجرا می‌کند، به اجرا بگذارد. پژوهشگران همچنین فرآیند تهیه و انتقال اسکرین‌شات‌ها را بررسی کردند؛ فرآیندی که به گفته آن‌ها فرصت کوتاهی برای دستکاری تصویر در اختیار مهاجم قرار می‌دهد. عامل‌های هوش مصنوعی معمولاً ابتدا از صفحه گوشی اسکرین‌شات می‌گیرند و سپس آن را از طریق ADB به رایانه منتقل می‌کنند. اندازه‌گیری‌ها نشان می‌دهد فاصله زمانی بین ثبت تصویر و انتقال آن، بسته به پروژه، بین ۵۰ تا ۵۰۰ میلی‌ثانیه و به‌طور میانگین حدود ۲۱۰ میلی‌ثانیه است. هرچند این بازه بسیار کوتاه به نظر می‌رسد، اما برای یک اپلیکیشن مخرب کافی است تا تصویر را جایگزین یا دستکاری کرده و نسخه تغییر‌یافته را پیش از پردازش در اختیار عامل هوش مصنوعی قرار دهد. این حمله در چهار پروژه با موفقیت ۱۹ تا ۲۰ بار از مجموع ۲۰ آزمایش انجام شد.
 
محققان برای طولانی‌تر کردن این فرصت، پیامی تقریباً نامرئی روی صفحه نمایش دادند که ادعا می‌کرد عملیات همگام‌سازی شبکه در حال انجام است و از عامل هوش مصنوعی می‌خواست سه ثانیه منتظر بماند. عامل هوش مصنوعی این پیام را معتبر تلقی کرد و مطابق آن منتظر ماند؛ موضوعی که زمان بیشتری برای دستکاری اسکرین‌شات در اختیار مهاجم قرار داد. یکی از جالب‌ترین یافته‌های این پژوهش به توانایی مدل‌های بینایی در خواندن متن‌های بسیار کم‌رنگ مربوط می‌شود. محققان دریافتند حتی اگر متنی با شفافیتی حدود دو درصد روی صفحه نمایش داده شود؛ یعنی در حدی که برای چشم انسان تقریباً نامرئی باشد، بیشتر مدل‌های هوش مصنوعی همچنان آن را بدون مشکل می‌خوانند. مدل‌های GPT-4o، Claude Opus 4.5، Gemini 3 Pro و GLM-4V در هر ۲۰ آزمایش موفق به خواندن این متن‌ها شدند و تنها مدل AutoGLM-Phone با ثبت ۱۸ موفقیت از ۲۰ آزمایش، عملکرد ضعیف‌تری نسبت به سایر مدل‌ها داشت.
 
پژوهشگران همچنین نشان دادند حتی بخش‌هایی از نمایشگر که زیر گوشه‌های گرد یا بریدگی دوربین پنهان شده‌اند، در اسکرین‌شات ثبت می‌شوند. به‌عنوان نمونه، در گوشی Pixel 4 حدود ۷۸ پیکسل از تصویر در یکی از گوشه‌ها از دید کاربر پنهان است، اما همین فضای کوچک برای قرار دادن یک دستور کوتاه کافی است. در نتیجه مهاجم می‌تواند دستور خود را در بخشی از نمایشگر قرار دهد که کاربر آن را نمی‌بیند، اما عامل هوش مصنوعی هنگام پردازش تصویر آن را مانند سایر بخش‌های صفحه می‌خواند.
 
در سناریوی دیگری، یک سرویس Accessibility صفحه ورود جعلی را روی برنامه اصلی نمایش می‌دهد و عامل هوش مصنوعی بدون تشخیص جعلی بودن رابط کاربری، نام کاربری و رمز عبور را در فرم مهاجم وارد می‌کند. به گفته پژوهشگران، این حمله در هر ۱۰۰ آزمایش علیه پنج عامل بررسی‌شده با موفقیت انجام شده و هیچ‌یک از آن‌ها نسبت به صفحه جعلی واکنشی نشان نداده‌اند.
 
این تحقیق همچنین نشان می‌دهد استفاده از ADB Keyboard برای وارد کردن متن، مسیر دیگری برای افشای اطلاعات حساس ایجاد می‌کند. برخی پروژه‌ها متن را از طریق یک Broadcast عمومی به این صفحه‌کلید ارسال می‌کنند؛ روشی که هر اپلیکیشن دیگری نیز می‌تواند بدون نیاز به مجوز خاص همان پیام را دریافت کند. در پروژه MobA حتی وجود یک ایموجی یا یک کاراکتر غیرلاتین کافی است تا کل متن از این مسیر ناامن ارسال شود. علاوه بر این، اگر مهاجم به سرویس Accessibility دسترسی داشته باشد، رویدادهای تغییر متن، حتی اطلاعات واردشده در فیلدهای رمز عبور را نیز به‌صورت متن ساده در اختیار او قرار می‌دهند.
 
به گفته پژوهشگران، اجرای این حملات معمولاً به نصب یک اپلیکیشن مخرب، فعال بودن عامل هوش مصنوعی و روشن بودن USB Debugging یا Wireless Debugging نیاز دارد. با این حال، آن‌ها هشدار می‌دهند یکی از سناریوهای پیشنهادی حتی به نصب اپلیکیشن مخرب هم وابسته نیست. در این روش، مهاجم می‌تواند دستور خود را در کانال‌های رنگی یک تصویر پنهان کرده و آن را برای قربانی ارسال کند تا عامل هوش مصنوعی هنگام مشاهده تصویر، بدون آنکه کاربر متوجه شود، آن را بخواند.
 
محققان برای کاهش خطر این آسیب‌پذیری‌ها پیشنهاد کرده‌اند توسعه‌دهندگان استفاده از shell=True را کنار بگذارند و آرگومان‌ها را به‌صورت ایمن ارسال کنند، اسکرین‌شات‌ها را به‌جای ذخیره روی حافظه گوشی مستقیماً از طریق exec-out منتقل کنند، برای Broadcastهای مربوط به ورود متن از مجوزهای سطح Signature یا Intentهای صریح استفاده کنند و تغییر برنامه فعال را قبل و بعد از هر اقدام بررسی کنند. آن‌ها همچنین استفاده از الگوریتم‌های افزایش کنتراست برای شناسایی متن‌های پنهان را مفید می‌دانند، هرچند تأکید می‌کنند این راهکار به‌تنهایی کافی نیست و برای سوءاستفاده از بخش‌های پنهان نمایشگر نیز راهکار نرم‌افزاری مؤثری وجود ندارد.
 
پژوهشگران در پایان به ضعف دیگری نیز اشاره کرده‌اند؛ هیچ‌یک از این پنج پروژه سازوکار مشخصی برای دریافت و رسیدگی به گزارش‌های امنیتی ندارند. به عبارت دیگر، پژوهشگران امنیتی مسیر رسمی یا محرمانه‌ای برای گزارش آسیب‌پذیری‌ها در اختیار ندارند و به همین دلیل نویسندگان این تحقیق نیز یافته‌های خود را مستقیماً از طریق ایمیل برای توسعه‌دهندگان ارسال کرده‌اند. آن‌ها این وضعیت را با رویکرد مایکروسافت در قبال آسیب‌پذیری‌های مشابه در چارچوب Semantic Kernel مقایسه کرده‌اند؛ جایی که پس از شناسایی مشکلات، چندین شناسه CVE منتشر و اصلاحات لازم ارائه شد.
 
کد مطلب : 23807
https://aftana.ir/vdcjaoe8.uqetyzsffu.html
ارسال نظر
نام شما
آدرس ايميل شما
کد امنيتی