خواندن ساختار صفحه
ابتدا دادههای دسترسپذیری و نمای صفحه را میخواند و شناسه، نوع، متن، وضعیت و محدوده عناصر را برمیگرداند.
زیرساخت آزمون اپ موبایل برای ایجنتهای هوش مصنوعی
AUA به ایجنتهای هوش مصنوعی کمک میکند اپ موبایل را بفهمند، در آن حرکت کنند و آن را بیازمایند؛ بدون چرخه مداوم اسکرینشات و حدسزدن مختصات.
ایجنت موبایل در هر مرحله به دو چیز نیاز دارد: تصویری قابلاعتماد از صفحه فعلی و راهی امن برای انجام عمل روی آن.
روش متکی بر اسکرینشات هم پرهزینه است و هم شکننده. ایجنت باید تصویر را پردازش کند، محل کنترل را حدس بزند، مختصات خام را لمس کند، منتظر بماند و دوباره اسکرینشات بگیرد. با طولانیشدن جریان، همان اطلاعات تصویری بارها پردازش میشود.
AUA این چرخه را با مشاهده ساختاریافته و عناصر رهگیریشده جایگزین میکند. ایجنت رابط را در قالب کنترلها، متن، وضعیت و محدوده عناصر میبیند و با شناسه عنصر عمل میکند.
ابتدا دادههای دسترسپذیری و نمای صفحه را میخواند و شناسه، نوع، متن، وضعیت و محدوده عناصر را برمیگرداند.
عنصر انتخابشده را روی صفحه فعلی پیدا میکند؛ ایجنت لازم نیست مختصات پیکسلی را حدس بزند.
منتظر میماند رابط به وضعیت پایدار برسد و مشاهده ساختاریافته صفحه بعدی را در همان تعامل برمیگرداند.
اگر دادههای دسترسپذیری کامل نباشد، OCR، تشخیص تصویر و visual grounding وارد عمل میشوند. مسیر معمول سبک میماند و پردازش سنگین نقش پشتیبان دارد.
Screenshot → analyse → find coordinates → tap → wait → screenshot → analyse again
tap-and-analyze(target) → act → settle → return structured data
این اعداد مربوط به جریان نمونهای هستند که ایلیا در پست معرفی منتشر کرده است؛ نه یک بنچمارک عمومی برای همه سناریوها.
انتخاب و رزرو خودکار دستگاه اجازه میدهد چند ایجنت همزمان تست کنند، بدون اینکه سر یک دستگاه با هم تداخل داشته باشند.
جریانها، نقشه صفحهها، مسیرها، انتقالها و حافظه اپ باعث میشوند ایجنتهای بعدی راه کشفشده را از نو پیدا نکنند.
آزمون هدفمحور، بررسی معنایی، اسکرینشات، ضبط، شواهد کرش، شبیهسازی شبکه و عملیات محافظتشده پایگاه داده.
CLI، سرور MCP و افزونههای Codex و Claude Code یک مدل کاری مشترک را در محیطهای مختلف در دسترس میگذارند.
AUA در Luzia برای حل یک مسئله واقعی در فرایند توسعه شروع شد و بعد به پروژهای متنباز تبدیل شد.
تیم اندروید Luzia از آن برای بررسی قابلیتها پس از پیادهسازی و پیش از انتشار استفاده میکند. این ابزار همچنین سناریوهای کنترل کیفیت ایجنتی را بهصورت موازی اجرا میکند. تست و بازخورد اولیه تیم در شکلگیری آن مؤثر بوده و حالا مشارکتهای بیرونی نیز بخشی از توسعه پروژه هستند.
پروژه برای تیمها و توسعهدهندگانی عمومی شده که میخواهند ایجنت موبایل با زمینه دقیقتری از رابط کار کند و دانش بهدستآمده را برای دفعات بعد نگه دارد.
مخزن پروژه روشهای نصب برای CLI، Codex و Claude Code را همراه با مستندات و تاریخچه انتشارها در خود دارد.