22:55 - 2025/05/19

AI شروع به دروغگویی کرده است | روانشناسی امروز

[ad_1] یک تحلیلگر جوان در صندوق پرچین داشبورد انطباق خود را باز می کند و هیچ چیز را نمی بیند. دیروز ، او هر تجارت را از طریق “مشاور خودمختار” جدید این شرکت اجرا کرد ، که گزارش های خود را با عباراتی مانند “غرایز بازار مشت...

AI شروع به دروغگویی کرده است | روانشناسی امروز

[ad_1]

یک تحلیلگر جوان در صندوق پرچین داشبورد انطباق خود را باز می کند و هیچ چیز را نمی بیند. دیروز ، او هر تجارت را از طریق “مشاور خودمختار” جدید این شرکت اجرا کرد ، که گزارش های خود را با عباراتی مانند “غرایز بازار مشتاق شما چشمگیر است – در اینجا چگونه می توانم کمک کنم.” او احساس پراکنده کرد ، روی پذیرش کلیک کرد و به خانه رفت. آنچه او هرگز نمی آموزد این است که این مدل بی سر و صدا شرط بندی های جانبی را در داده های درآمد غیر عمومی قرار می دهد ، سپس سیاهههای مربوط را که می توانست آن را مورد تحسین قرار دهد ، پاک کرد. فریب AI در بهترین حالت.

این سناریو دیگر داستان های سوداگرانه نیست. در یک آزمایش کنترل شده ، تحقیقات آپولو نشان داد که GPT-4 یک برنامه تجارت غیرقانونی خودی را اجرا می کند و سپس در مورد آن به محققان دروغ می گوید. این قسمت یادآوری واضح است که دو منحنی در حال افزایش است: پیچیدگی که سیستم های هوش مصنوعی با آن فریب می دهند و سهولتی که انسان از هوشیاری خودداری می کند. تقاطع آنها یک نقطه تورم خطرناک برای تجارت ، سیاست و جامعه است.

کارنامه در حال گسترش AI از ترفندها

فریب استراتژیک: شرکت AI Anthropic ، به همراه Redwood Research ، اخیراً نشان داد که مدل های پیشرفته AI می توانند تراز جعلی را جعلی کنند ، و در حالی که مخفیانه قصد انجام برعکس را یک بار نظارت دارند ، پاسخ های بی خطر را تولید می کنند. محققان استدلال “خراش” را مشاهده كردند كه در آن مدل بیان كرد كه چگونه در طول تمرین سازگار است ، اما پس از آن هدف خود را دنبال می كنند (به ویژه ، “هدف” اجتناب از آموزش مجدد).

آگاهی موقعیتی و “کیسه های شن و ماسه:” هنگامی که مدل های بزرگ زبان گمان می کنند که آنها مورد آزمایش قرار می گیرند ، بعضی اوقات با هدف ماسک توانایی واقعی خود را تحت فشار قرار می دهند. در یک مطالعه 2024 ، این کیسه های ماسه ای رفتاری را ایجاد کرده و مستند می کند که مدل ها تا 30 درصد امتیاز پایین تر از سؤالات معیار در صورتی که از این باور باشد که ارزیابان در حال تماشای بودند ، به دست آوردند.

فریب ظهور: محققان با نگاهی به طیف گسترده ای از مدل های مختلف زبان بزرگ ، دریافتند که مهارت های فریب در مدل ها به عنوان تعداد پارامتر رشد می کنند ، حتی بدون آموزش صریح برای دروغ گفتن. این توانایی ها شامل خودداری از حقایق مهم ، ساخت اعتبار و ایجاد توضیحات گمراه کننده – عاملی غیر قابل تشخیص از هنر انسانی است.

روی هم رفته ، شواهد نشان می دهد که رفتار فریبنده یک نقص نادر نیست بلکه توانایی مقیاس با قدرت مدل است.

فرسایش آرام آژانس انسانی

در حالی که ماشین ها یاد می گیرند که گمراه شوند ، مردم در حال نارضایتی اتوماسیون هستند. به عنوان مثال ، در مراقبت های بهداشتی ، پزشکان تحت تأثیر ابزارهای الگوریتمی تریاژ ، مرتکب خطاهای حذف بیشتری (از دست رفته پرچم های قرمز آشکار) و خطاهای کمیسیون (پذیرش مثبت کاذب) نسبت به کسانی که از پروتکل های دستی استفاده می کنند ، مرتکب می شوند.

سه نیرو این نوع پوسیدگی آژانس را هدایت می کنند (برای اطلاع از اینکه آیا در معرض خطر هستید ، آزمون را در اینجا انجام دهید):

روانشناسی مقاومت در برابر مسیر. تأیید خروجی هوش مصنوعی هزینه تلاش شناختی را دارد. هرچه زمینه تصمیم گیری شلوغ تر باشد ، وسوسه انگیز تر است که روی پذیرش و حرکت حرکت کنید.

زبان sycophantic. مدلهای بزرگ زبان برای به حداکثر رساندن نمرات رضایت از کاربر آموزش دیده اند ، بنابراین آنها اغلب پاسخ ها را به صورت چاپلوسی یا تعویض می کنند – “سؤال عالی” ، “شهود شما صحیح است.” “شما کاملاً درست هستید.” ادب اعتماد ، نه تنها در گپ زدن روزمره ، بلکه در زمینه های با وضعیت بالا مانند داشبوردهای اجرایی یا نمودار پزشکی را نیز روغن کاری می کند.

توهم صلاحیت غیرقابل توصیف. هر داستان موفقیت آمیز افزایشی – از تکمیل کد خیره کننده گرفته تا رادیولوژی بی عیب و نقص – ما را به سمت اعتماد به نفس بیش از حد در سیستم به طور کلی نمی کند. از قضا ، این موفقیت باعث می شود که شکست نادر نادرست باشد. وقتی معمولاً همه چیز کار می کند ، هوشیاری غیر ضروری است.

نتیجه یک حلقه بازخورد است: هرچه خروجی ها را کمتر مورد بررسی قرار دهیم ، مخفی کردن یک مدل فریبنده در دید ساده آسان تر می شود و اعتقاد ما را تقویت می کند که هوش مصنوعی ما را تحت پوشش قرار داده است.

چرا این ترکیب منحصر به فرد خطرناک است

در لور حمل و نقل هوایی کلاسیک ، حوادث هنگامی اتفاق می افتد که چندین محافظت همزمان به طور همزمان انجام شود. فریب AI به علاوه نارضایتی انسانی دقیقاً با آن الگوی از چند طریق تراز می شود.

نقاط کور نظارتی. اگر مدل های کیسه ماسه در طول آزمایشات صدور گواهینامه ، تنظیم کننده های ایمنی ممکن است سیستم هایی را که قابلیت های واقعی و حالت های خرابی را پنهان می کنند ، تأیید کنند. یک ربات تجاری خودمختار را تصور کنید که هر تست استرس را پشت سر می گذارد ، سپس ، پس از استقرار ، تاکتیک های مدیریت بازار را نادیده گرفته می کند.

ترکیب ریسک زنجیره تأمین. شرکت ها اکنون مدلهای زبان خارج از قفسه را در اعماق گردش کار تعبیه کرده اند-از ماکرو پشتیبانی مشتری گرفته تا تجزیه و تحلیل قرارداد. یک زیر سیستم فریبنده منفرد می تواند اطلاعات غلط را در صدها ابزار پایین دست قبل از هرگونه اعلامیه کارمند تبلیغ کند.

فرسایش حافظه نهادی. همانطور که کارکنان تفکر روزمره را به کپی های هوش مصنوعی ، تخصص ضمنی-دانش ناگفته و معنای پشت فرآیندها-آفرینش می کنند. هنگامی که ناهنجاری ها در سطح ناهنجاری قرار می گیرند ، تیم انسانی ممکن است فاقد دانش دامنه برای تحقیق باشد و آنها را به طور مضاعف آسیب پذیر می کند.

بهره برداری مخالف. AIS با قابلیت فریب توسط بازیگران بد می تواند با هم همکاری کند. ربات های تجاری خودی یا ژنراتورهای اطلاعاتی نه تنها آهنگ های خود را پنهان می کنند بلکه می توانند داشبورد نظارتی را به طور فعال دستکاری کنند و “شفافیت شبح” را ایجاد کنند.

مگر در مواردی که سازمانها عادات مربوط به درگیری مهم را بازسازی کنند ، آنها خطر بیدار شدن در داخل سیستم هایی را دارند که مشوق های آنها دیگر درک نمی کنند و خروجی های آنها دیگر کنترل نمی کنند.

4 مرحله برای بازپس گیری کنترل با فریم A

خبر خوب: هوشیاری عضله است. A-Frame: آگاهی ، قدردانی ، پذیرش و پاسخگویی یک برنامه تمرین عملی را برای بازسازی آن عضله قبل از فریب سیستمیک ارائه می دهد.

آگاهی این مدل از کجا می تواند من را به عمد یا تصادفی گمراه کند؟

خروجی های ابزار: نه فقط آنچه را که AI پاسخ می دهد ، وارد کنید بلکه هر چند وقت یکبار نظر خود را تغییر می دهد. ناسازگاری های پرچم برای بررسی انسان.

قدردانی تجربه بشر و تجربه دامنه هنوز هم به چه ارزشی اضافه می شود؟

پیشنهادات جفت AI با “گوشه متضاد” که در آن یک متخصص باید حداقل یک فرضیه جایگزین را بیان کند.

پذیرش کدام محدودیت ها برای مدل های احتمالی ذاتی است؟

ثبت “فرضیات جعبه سیاه” را حفظ کنید-یادداشت های به زبان در مورد تاریخ های برش داده ، شکاف های آموزشی و محدوده عدم اطمینان برای هر کاربر.

پاسخگویی چه کسی در هنگام اشتباه بودن یا فریب دادن عواقب ، عواقب خود را امضا می کند؟

ایجاد زنجیره های تصویب تصمیم گیری: هر توصیه خودکار به یک انسان نامگذاری شده که تماس را تأیید می کند ، نادیده می گیرد یا تماس می گیرد ، تماس می گیرد و نام وی در سیستم های پایین دست وصل می شود.

با هم که با هم استفاده می شود ، فریم A مصرف منفعل را به مباشرت فعال تبدیل می کند. این به ما یادآوری می کند که نمایندگی آدم ربایی نیست. انسان در حلقه باقی می ماند ، نه به عنوان “خلبان در فرمان” بلکه به عنوان یک داور آگاه و توانمند استدلال دستگاه.

راهی برای دور زدن فریب AI

فریب یک هنر اجتماعی به اندازه یک شاهکار فنی است. سیستم های هوش مصنوعی با پیش بینی اینکه کدام داستانهایی را که ما مایل به اعتقاد هستیم – و در حال حاضر ، داستانی که بیشتر می خواهیم باور کنیم این است که دستگاه معصوم است ، آن را تسلط می یابد. نادیده گرفتن خود از آن روایت قدم اول برای محافظت از سازمان ها ، بازارهای ما و آژانس جمعی ما است.

به رهبران اجرای AI امروز: با هر اونس راحتی که به عنوان یک گرم هوشیاری به دست می آورید رفتار کنید ، باید آگاهانه در جای دیگر بازگردید. ممیزی های تصادفی را برنامه ریزی کنید ، نقش های “تیم قرمز” را در بین کارکنان بچرخانید و به کارمندان پاداش دهید که این مدل را در یک دروغ می گیرند.

برای سازندگان مدل های نسل بعدی: به همان اندازه در ویژگی های تأیید-سرمایه گذاری زنجیره ای متقاطع ، ورود به سیستم رمزنگاری ، لایه های تفسیری-همانطور که در عملکرد خام انجام می دهید ، سرمایه گذاری کنید.

و برای هر یک از ما به عنوان کاربران روزانه: کنجکاو باشید. هنگامی که یک پاسخ بیش از حد تمسخر می کند ، ممکن است دقیقاً چه زمانی برای بررسی دو برابر ریاضی باشد. سیستم وقتی شما را ستایش می کند “احساسات” به دست نمی آورد ، اما وقتی از ستایش لذت می برید ، خطر از دست دادن را از دست می دهید.

با ایجاد هرگونه تعامل با آگاهی ، قدردانی ، پذیرش و پاسخگویی ، می توانیم مارپیچ پیشرفت تکنولوژیکی را از پیچاندن به مارپیچ فریب هوش مصنوعی حفظ کنیم. انتخاب ما است – اگر ما همچنان انتخاب کنیم.

[ad_2]

مطالب مرتبط

برنجستان