در یک مطالعه پیشگامانه که در ژورنال Science منتشر هوش مصنوعی به زبان ساده برای کودکان شده است، محققان یک مدل یادگیری ماشینی ایجاد کرده اند که روش یادگیری زبان را در کودکان تقلید می کند و بینش جدیدی را در مورد فراگیری اولیه زبان ارائه می دهد. با استفاده از ضبطهای ویدئویی و صوتی از دیدگاه یک کودک خردسال، این مدل با موفقیت یاد گرفت که کلمات را با اشیاء بصری مرتبط کند، شاهکاری که روند اسرارآمیز چگونگی شروع هوش مصنوعی به زبان ساده برای کودکان درک و استفاده کودکان از زبان را روشن میکند.
درک چگونگی یادگیری زبان توسط کودکان از دیرباز موضوعی جذاب برای دانشمندان و مربیان بوده است. در قلب این پدیده پیوند کلمات به معانی آنها است - فرآیندی به ظاهر ساده و در عین حال فوق العاده پیچیده. این مطالعه به دنبال ابهام زدایی از این فرآیند با استفاده از آخرین پیشرفتهای هوش مصنوعی است.
انگیزه پشت این تحقیق در نیاز به درک عمیق تر از اکتساب زبان اولیه نهفته است. هوش مصنوعی به زبان ساده برای کودکان به طور سنتی، مطالعات در این زمینه در محیط های آزمایشگاهی کنترل شده انجام می شود، که ممکن است به طور دقیق محیط طبیعی را که کودکان در آن زبان یاد می گیرند، منعکس نکند.
علاوه بر این، علاقه فزاینده ای به توسعه سیستم های هوش مصنوعی وجود دارد که می توانند زبان را به روش هایی شبیه به انسان یاد بگیرند. محققان امیدوارند با کشف مکانیسمهایی که در پس چگونگی پیوند کودکان کلمات هوش مصنوعی به زبان ساده برای کودکان با همتایان بصری خود وجود دارد، نه تنها علم شناختی را غنیتر کنند، بلکه توسعه سیستمهای هوش مصنوعی پیشرفتهتر را نیز راهنمایی کنند.
"من از ابتدای کار تحقیقاتی خود در مورد مفاهیم و اکتساب زبان تحقیق کرده ام، زیرا فکر می کنم سوالات جالب زیادی در پس چگونگی یادگیری و استفاده از مفاهیم و زبان توسط انسان ها و ماشین ها وجود دارد. کار با مجموعه داده ای که در این مقاله استفاده شده است (مجموعه داده SAYCam-S) فرصتی منحصر به فرد برای مطالعه این نوع سؤالات فراهم می کند و دیدن اینکه آیا مدل ها می توانند از برش های طبیعی از ورودی یک کودک چیزی یاد بگیرند یا خیر. هوش مصنوعی به زبان ساده برای کودکان وانگ، دانشمند محقق در مرکز علوم داده در دانشگاه نیویورک.
مجموعه داده SAYCam-S با استفاده از یک دوربین روی سر که توسط یک کودک استفاده میشد، جمعآوری شد و از سن 6 تا 25 ماهگی فیلم و صدا ضبط میکرد. مجموعه داده شامل 600000 فریم ویدیویی همراه با 37500 قول رونویسی شده بود که از 61 ساعت ویدیو به دست آمده بود. این رویکرد با هدف منعکس کردن محیط یادگیری طبیعی کودک، در تضاد با تنظیمات کنترلشدهتر مطالعات آزمایشگاهی سنتی بود.
وونگ و همکارانش یک مدل یادگیری ماشینی به نام دیدگاه کودک برای مدل یادگیری متضاد (CVCL) ایجاد کردند که فریمهای ویدیویی را نشان میداد که نشاندهنده آنچه کودک میدید و گفتههای زبانی، نشاندهنده آنچه کودک میشنید، تغذیه میشد.
مدل CVCL برای یادگیری بازنمایی های چندوجهی - ترکیبی از هوش مصنوعی به زبان ساده برای کودکان عناصر بصری و زبانی - و مرتبط ساختن آنها با یکدیگر طراحی شده است. آموزش CVCL تحت نظارت خود بود، به این معنی که بر برچسبگذاری خارجی دادهها متکی نبود. در عوض، این مدل با مرتبط کردن فریمها و گفتههای ویدیویی همزمان بهعنوان جفتهای منطبق، و تلقی جفتهای غیرهمزمان بهعنوان ناهماهنگی یاد گرفت.
این رویکرد یادگیری متضاد با هدف تقلید از روشی که کودکان زبان را یاد میگیرند - با مرتبط کردن کلماتی که میشنوند با اشیا و رویدادهایی که در محیط خود میبینند، انجام میدهد. در طول آموزش، هوش مصنوعی به زبان ساده برای کودکان مدل بهطور تصادفی از فریمهای ویدیویی مرتبط با هر گفته نمونهبرداری کرد و برای یادگیری قوی، دادهها را در این تصاویر اعمال کرد.
عملکرد مدل در برابر طیف وسیعی از کلمات روزمره و مراجع بصری متناظر آنها در وظایف طبقهبندی ارزیابی شد. همچنین بر روی توانایی آن در تعمیم به نمونههای بصری جدید که در طول آموزش دیده نمیشوند و همسو کردن سیستمهای مفهومی بصری و زبانی به طور گسترده آزمایش شد.
با استفاده از مدلهای هوش مصنوعی برای مطالعه مشکل واقعی یادگیری زبان هوش مصنوعی به زبان ساده برای کودکان که کودکان با آن مواجه هستند، میتوانیم به بحثهای کلاسیک درباره اینکه کودکان برای یادگیری لغات به چه عناصری نیاز دارند، بپردازیم - اینکه آیا آنها برای ادامه کار به تعصبات خاص زبان، دانش ذاتی یا فقط یادگیری تداعی نیاز دارند. برندن لیک، یکی از نویسندگان، استادیار دانشگاه نیویورک توضیح داد.
این مدل به دقت طبقهبندی 61.6 درصد بر روی مجموعه دادههایی از فریمهای حاشیهنویسی شده با 22 مفهوم بصری دست یافت که توانایی آن را در تطبیق کلمات با اشیاء بصری به طور مؤثر نشان میدهد. در آزمایشهای مقایسه، CVCL نزدیک به یک شبکه عصبی متضاد تصویر-متن آموزشدیدهتر، CLIP، که بر روی دادههای بسیار بیشتری آموزش داده شده بود، انجام داد. این مدل دانش اندکی از مفاهیم بصری اضافی را هنگام آزمایش بر روی Artificial intelligence in plain language for children محرکهای جدید، با دقت 34.7٪ نشان داد. این مهم است زیرا توانایی مدل را برای تعمیم فراتر از آموزش آن نشان می دهد.