نسل جدید هوش مصنوعی دیگر فقط به سؤالهای کاربران پاسخ نمیدهد. Agentهای هوش مصنوعی میتوانند هدفی را دریافت کنند، مراحل انجام آن را برنامهریزی کنند و سپس با استفاده از کامپیوتر، مرورگر و نرمافزارهای مختلف، بخش بزرگی از کار را بهصورت خودکار انجام دهند.
این تغییر اهمیت زیادی دارد؛ زیرا برای نخستین بار هوش مصنوعی میتواند بهجای اینکه صرفاً به کاربر بگوید چه کاری انجام دهد، خودش آن کار را انجام دهد.
فناوریهایی مانند Computer Use در محصولات شرکتهایی مانند OpenAI، Anthropic، Google و Microsoft نشان میدهند که تعامل مستقیم Agentها با رابط گرافیکی کامپیوتر در حال تبدیل شدن به یکی از مسیرهای مهم توسعه هوش مصنوعی است.
اما این فناوری دقیقاً چگونه کار میکند؟ Agent چطور میتواند موس را حرکت دهد، روی یک دکمه کلیک کند یا داخل یک نرمافزار چیزی بنویسد؟ و مهمتر از همه، آیا در آینده نرمافزارها را به همان شکلی که امروز استفاده میکنیم، کنترل خواهیم کرد؟
Agent هوش مصنوعی چیست؟
یک چتبات معمولی معمولاً در قالب یک چرخه ساده کار میکند:
سؤال کاربر ← پردازش درخواست ← تولید پاسخ
اما Agent میتواند چرخه بسیار طولانیتری داشته باشد:
هدف کاربر ← برنامهریزی ← استفاده از ابزارها ← مشاهده نتیجه ← اصلاح مسیر ← انجام مرحله بعدی ← تکمیل کار
برای مثال، اگر به یک Agent بگویید:
«اطلاعات سه لپتاپ را مقایسه کن و بهترین گزینه را انتخاب کن»
ممکن است Agent بتواند خودش سایتهای مختلف را بررسی کند، مشخصات محصولات را جمعآوری کند، اطلاعات را در یک جدول قرار دهد و در نهایت نتیجه را ارائه کند.
در مدلهای پیشرفتهتر، حتی تعامل با خود محیط کامپیوتر نیز امکانپذیر شده است.
Computer Use چیست؟
Computer Use به قابلیتی گفته میشود که به مدل هوش مصنوعی اجازه میدهد با محیط کامپیوتری مانند یک انسان تعامل داشته باشد.
در این روش، Agent لزوماً به یک API اختصاصی برای هر نرمافزار نیاز ندارد. در عوض میتواند محیط را ببیند، وضعیت صفحه را تحلیل کند و با ابزارهایی مانند موس و کیبورد با آن تعامل داشته باشد.
OpenAI در فناوری Computer-Using Agent یا CUA، همین رویکرد را برای تعامل با رابطهای گرافیکی به کار گرفته است. Anthropic نیز قابلیت Computer Use را برای Claude معرفی کرده و Microsoft هم Computer Use را به Agentهای Copilot Studio اضافه کرده است.
این موضوع یک تفاوت اساسی ایجاد میکند: Agent میتواند از همان رابطی استفاده کند که انسان استفاده میکند.
Agent چگونه صفحه کامپیوتر را میبیند؟
یکی از مهمترین بخشهای این فناوری، درک محتوای صفحه است.
Agent میتواند تصویر یا وضعیت فعلی صفحه را دریافت کند و عناصر مختلف آن را تشخیص دهد؛ برای مثال:
- دکمهها
- منوها
- کادرهای متنی
- آیکونها
- جدولها
- پنجرهها
- پیامهای خطا
- محتوای یک وبسایت
در نتیجه، مدل فقط با متن خام کار نمیکند و میتواند ساختار بصری محیط را نیز در تصمیمگیری خود وارد کند.
برای مثال، اگر صفحهای شامل دکمه «Download» باشد، Agent باید بتواند آن را تشخیص دهد، موقعیتش را در صفحه پیدا کند و تصمیم بگیرد که کلیک روی آن مرحله مناسبی از اجرای وظیفه است.
از دیدن صفحه تا حرکت موس
بعد از تحلیل صفحه، Agent باید تصمیم بگیرد چه کاری انجام دهد.
این چرخه معمولاً به شکل زیر انجام میشود:
مشاهده صفحه ← تحلیل وضعیت ← تصمیمگیری ← حرکت موس یا کیبورد ← مشاهده نتیجه ← تصمیم بعدی
به این ترتیب Agent یک بار صفحه را نمیبیند و تمام کار را انجام دهد؛ بلکه مرتب وضعیت محیط را بررسی میکند و بر اساس نتیجه اقدامات قبلی مسیر خود را تغییر میدهد.
برای مثال، اگر بعد از کلیک روی یک گزینه پنجره جدیدی باز شود، Agent باید متوجه تغییر صفحه شود و مرحله بعدی را بر اساس وضعیت جدید انتخاب کند.
Agentها چگونه با نرمافزارهای معمولی کار میکنند؟
نکته جالب Computer Use این است که نرمافزار الزاماً برای استفاده توسط هوش مصنوعی طراحی نشده است.
یک Agent میتواند با محیطهایی مانند:
- مرورگر وب
- نرمافزارهای اداری
- فرمهای اینترنتی
- ابزارهای مدیریت اطلاعات
- محیطهای توسعه نرمافزار
- سیستمهای داخلی شرکتها
- نرمافزارهای قدیمی فاقد API
کار کند.
این ویژگی میتواند برای سازمانهایی که نرمافزارهای قدیمی دارند بسیار مهم باشد؛ زیرا لازم نیست برای هر برنامه یکپارچهسازی کاملاً جدید ساخته شود.
تفاوت Agent با اتوماسیون سنتی چیست؟
اتوماسیون سنتی معمولاً بر اساس دستورهای از پیش تعریفشده کار میکند.
برای مثال:
اگر دکمه X ظاهر شد ← روی آن کلیک کن
اما Agent میتواند انعطاف بیشتری داشته باشد.
اگر دکمه جای دیگری قرار گرفته باشد یا ظاهر صفحه کمی تغییر کند، Agent میتواند دوباره صفحه را تحلیل کرده و مسیر دیگری را امتحان کند.
البته این به معنی بینقص بودن Agent نیست. مدلهای فعلی هنوز ممکن است در مواجهه با رابطهای پیچیده، تغییرات غیرمنتظره یا اطلاعات مبهم اشتباه کنند.
Agentها میتوانند اشتباه خود را اصلاح کنند
یکی از قابلیتهای مهم این سیستمها، امکان بازبینی نتیجه اقدامات قبلی است.
فرض کنید Agent برای باز کردن یک فایل روی گزینه اشتباه کلیک کند. اگر وضعیت جدید صفحه با انتظار آن مطابقت نداشته باشد، میتواند متوجه شود که مسیر قبلی درست نبوده است.
سپس ممکن است:
تشخیص خطا ← بازگشت ← انتخاب مسیر جدید ← اجرای دوباره
این قابلیت باعث میشود Agent از یک سیستم صرفاً دستوری فاصله بگیرد و بیشتر شبیه یک دستیار مستقل عمل کند.
چرا این فناوری اهمیت زیادی دارد؟
تا پیش از این، هوش مصنوعی معمولاً مجبور بود برای تعامل با نرمافزارها از ابزارهای اختصاصی استفاده کند.
اگر یک مدل میخواست با یک سرویس خاص کار کند، توسعهدهندگان باید API آن سرویس را در اختیار Agent قرار میدادند.
Computer Use مسیر دیگری را پیشنهاد میکند:
بهجای اینکه برای هر نرمافزار ابزار مخصوص بسازیم، Agent خود نرمافزار را مانند انسان استفاده کند.
این موضوع میتواند تعداد زیادی از محدودیتهای فعلی Agentها را کاهش دهد.
آینده نرمافزارها ممکن است تغییر کند
اگر Agentها بتوانند با نرمافزارهای مختلف کار کنند، شیوه استفاده ما از برنامهها نیز میتواند تغییر کند.
امروز برای انجام یک کار باید بدانیم:
- کدام نرمافزار را باز کنیم؟
- کدام گزینه را انتخاب کنیم؟
- اطلاعات را در کدام قسمت وارد کنیم؟
- فایل را از کجا پیدا کنیم؟
- چگونه خروجی بگیریم؟
اما در آینده ممکن است فقط هدف را بیان کنیم.
برای مثال:
«این فایل را به یک ارائه ۱۰ اسلایدی تبدیل کن و نسخه نهایی را در پوشه پروژه قرار بده.»
Agent میتواند خودش نرمافزار مناسب را باز کند، فایل را پردازش کند، ارائه را بسازد و آن را ذخیره کند.
در این مدل، دانستن نحوه کار با نرمافزار اهمیت کمتری پیدا میکند و توانایی تعریف دقیق هدف اهمیت بیشتری خواهد داشت.
نرمافزار از ابزار به رابط تبدیل میشود
یکی از تغییرات مهم احتمالی این است که کاربران کمتر به منوها و دکمهها فکر کنند.
در مدل سنتی، کاربر باید زبان نرمافزار را یاد بگیرد.
در مدل Agentمحور، ممکن است کاربر هدف خود را به زبان طبیعی بیان کند و Agent ترجمه این هدف به مجموعهای از اقدامات را بر عهده بگیرد.
در نتیجه، نرمافزار از یک ابزار مستقیم برای کاربر به محیطی تبدیل میشود که Agent میتواند آن را کنترل کند.
Agentها در محیط کاری چه کارهایی انجام میدهند؟
کاربردهای این فناوری بسیار گسترده است.
کارهای اداری
Agent میتواند در آینده بخش زیادی از کارهای تکراری مانند ورود اطلاعات، انتقال داده میان نرمافزارها، ساخت گزارش و پردازش فرمها را انجام دهد.
مدیریت فایلها
برای مثال میتوان از Agent خواست:
«تمام فایلهای مربوط به پروژه X را پیدا کن، آنها را دستهبندی کن و یک پوشه برای فایلهای نهایی بساز.»
کار با مرورگر
یکی از مهمترین کاربردها، انجام وظایف چندمرحلهای در وب است؛ مانند جستوجو، مقایسه اطلاعات، تکمیل فرمها و انجام برخی عملیات آنلاین.
برنامهنویسی
Agentهای برنامهنویسی میتوانند علاوه بر تولید کد، فایلها را تغییر دهند، پروژه را اجرا کنند، خطاها را بررسی کنند و دوباره تغییرات لازم را اعمال کنند.
پشتیبانی سازمانی
شرکتها میتوانند Agentهایی بسازند که اطلاعات داخلی را پیدا کنند و کارهای تکراری کارکنان را انجام دهند.
Agentها لزوماً فقط با موس و کیبورد کار نمیکنند
Computer Use تنها یکی از روشهای تعامل Agent با نرمافزار است.
در محیطهایی که API یا ابزارهای ساختاریافته وجود دارد، استفاده مستقیم از API معمولاً میتواند سریعتر و دقیقتر باشد.
به همین دلیل، آینده احتمالاً ترکیبی از چند روش خواهد بود:
API ← ابزارهای تخصصی ← Computer Use ← مرور وب ← اجرای کد
Agent میتواند با توجه به نوع وظیفه، مناسبترین ابزار را انتخاب کند.
مشکل بزرگ؛ امنیت
هرچه Agent اختیار بیشتری روی کامپیوتر داشته باشد، خطرات نیز بیشتر میشوند.
فرض کنید Agent به مرورگر، فایلهای شخصی، حسابهای کاربری و حتی سیستم پرداخت دسترسی داشته باشد. یک اشتباه کوچک میتواند پیامد بسیار بزرگتری نسبت به یک پاسخ اشتباه در چت داشته باشد.
به همین دلیل شرکتهای فعال در این حوزه روی تأیید انسانی، محیطهای ایزوله و محدود کردن دسترسی Agentها تأکید دارند.
Prompt Injection یکی از خطرهای مهم Agentهاست
یکی از خطرهای جدی، Prompt Injection است.
تصور کنید Agent وارد یک وبسایت شود و داخل صفحه متنی پنهان یا آشکار وجود داشته باشد که به مدل دستور دهد برخلاف هدف کاربر عمل کند.
برای مثال، صفحه میتواند تلاش کند Agent را متقاعد کند که یک فایل خاص را ارسال کند یا اطلاعاتی را افشا کند.
از آنجا که Agent محتوای صفحات را میخواند و بر اساس آن تصمیم میگیرد، چنین حملاتی میتوانند خطرناک باشند.
به همین دلیل هرچه استقلال Agent بیشتر شود، طراحی سیستم امنیتی اطراف آن نیز اهمیت بیشتری پیدا میکند.
چرا کنترل انسانی همچنان ضروری است؟
Agent ممکن است برای کارهای کمخطر کاملاً مستقل عمل کند، اما برای فعالیتهایی مانند:
- خرید
- انتقال پول
- حذف فایل
- ارسال اطلاعات حساس
- تغییر تنظیمات مهم
- انتشار محتوا
بهتر است تأیید کاربر را دریافت کند.
مدل آینده احتمالاً این نیست که انسان کاملاً کنار گذاشته شود؛ بلکه انسان هدف و محدودیتها را مشخص میکند و Agent اجرای بخش بزرگی از کار را بر عهده میگیرد.
آیا Agentها جای نرمافزارها را میگیرند؟
احتمالاً نه به این شکل که نرمافزارها کاملاً ناپدید شوند.
در عوض، ممکن است نحوه دسترسی ما به نرمافزارها تغییر کند.
امروز کاربر مستقیماً با Photoshop، Excel، مرورگر یا نرمافزار حسابداری کار میکند.
در آینده ممکن است Agent بین چند نرمافزار جابهجا شود و کاربر فقط نتیجه نهایی را دریافت کند.
در چنین شرایطی، اهمیت یک نرمافزار فقط به رابط کاربری آن محدود نخواهد شد؛ قابلیت اتصال به Agentها، APIها و سیستمهای اتوماسیون نیز اهمیت بیشتری پیدا میکند.
آیا Agentهای کامپیوتری همین حالا قابل اعتماد هستند؟
هنوز نه بهطور کامل.
فناوری Computer Use پیشرفت زیادی کرده، اما مدلهای فعلی همچنان ممکن است اشتباه کنند.
مشکلاتی مانند تشخیص نادرست عناصر صفحه، کلیک اشتباه، برداشت نادرست از محتوای یک صفحه، گیر کردن در یک مرحله یا واکنش نامناسب به شرایط غیرمنتظره همچنان وجود دارند.
در نتیجه، برای کارهای حساس نمیتوان صرفاً به تصمیم Agent اعتماد کرد.
آینده چگونه خواهد بود؟
مسیر توسعه Agentها احتمالاً از چند مرحله عبور خواهد کرد.
در مرحله اول، Agentها وظایف ساده و تکراری را انجام میدهند.
بعد از آن، توانایی مدیریت پروژههای چندمرحلهای افزایش پیدا میکند.
در مرحله بعد، Agentها میتوانند بین چند نرمافزار و سرویس جابهجا شوند و کارهای پیچیدهتری را بدون دخالت مداوم کاربر انجام دهند.
در نهایت، ممکن است کاربر فقط هدف کلی را مشخص کند و Agent خودش برنامهریزی، انتخاب ابزار و اجرای مراحل را انجام دهد.
در چنین شرایطی، کامپیوتر دیگر صرفاً ابزاری برای اجرای دستورهای انسان نخواهد بود؛ بلکه به محیطی تبدیل میشود که عاملهای هوشمند میتوانند در آن کار کنند.
جمعبندی
Computer Use یکی از مهمترین گامهای توسعه Agentهای هوش مصنوعی است؛ زیرا مرز میان «هوش مصنوعی که پاسخ میدهد» و «هوش مصنوعی که عمل میکند» را کمرنگ میکند.
Agent با مشاهده صفحه، تحلیل وضعیت، تصمیمگیری و استفاده از موس و کیبورد میتواند با بسیاری از نرمافزارهایی کار کند که حتی برای هوش مصنوعی طراحی نشدهاند.
با این حال، مسیر رسیدن به Agentهای کاملاً قابل اعتماد هنوز تمام نشده است. خطا، Prompt Injection، حریم خصوصی و کنترل دسترسی همچنان چالشهای جدی هستند.
اما جهت حرکت فناوری کاملاً مشخص است: در آینده احتمالاً کاربران کمتر به این فکر خواهند کرد که «چطور با این نرمافزار کار کنم؟» و بیشتر خواهند گفت «میخواهم این کار انجام شود.»
این تغییر شاید یکی از مهمترین تحولاتی باشد که در سالهای آینده در رابطه میان انسان و نرمافزار اتفاق خواهد افتاد.
آی تی گیم اخبار فناوری، تکنولوژی و بازی

Agent هوش مصنوعی چیست؟
Agent چگونه صفحه کامپیوتر را میبیند؟
Prompt Injection یکی از خطرهای مهم Agentهاست
آیا Agentهای کامپیوتری همین حالا قابل اعتماد هستند؟