Brain2Qwerty V2؛ وقتی ذهن انسان مستقیماً با هوش مصنوعی صحبت میکند
مقدمه
زمانی که مغز انسان و هوش مصنوعی به یک زبان مشترک میرسند
برای سالها، ارتباط انسان با کامپیوتر به ابزارهایی مثل صفحهکلید، ماوس، صفحه لمسی و صدا محدود بوده است. ما همیشه مجبور بودهایم افکار خود را به یک شکل قابل فهم برای ماشین تبدیل کنیم؛ یعنی ابتدا فکر کنیم، سپس آن فکر را به حرکت دست، تایپ کردن یا صحبت کردن تبدیل کنیم و در نهایت کامپیوتر آن را پردازش کند.
اما تصور کنید روزی برسد که فاصله میان فکر انسان و پردازش کامپیوتر تقریباً حذف شود. زمانی که یک سیستم هوش مصنوعی بتواند الگوهای فعالیت مغز را دریافت کند و مستقیماً آنها را به زبان طبیعی تبدیل کند.
این همان نقطهای است که حوزهی رابط مغز و کامپیوتر (Brain-Computer Interface یا BCI) به دنبال رسیدن به آن است.
رابط مغز و کامپیوتر تلاش میکند یک مسیر ارتباطی مستقیم بین فعالیتهای عصبی مغز و سیستمهای دیجیتال ایجاد کند. در این فناوری، به جای اینکه انسان اطلاعات را از طریق عضلات منتقل کند، خود فعالیت مغز به عنوان منبع داده مورد استفاده قرار میگیرد.
پروژهی Brain2Qwerty V2 یکی از نمونههای جدید و پیشرفته در این مسیر است؛ پروژهای که نشان میدهد هوش مصنوعی میتواند از روی ثبتهای غیرتهاجمی مغزی، جملات کامل تایپشده را بازسازی کند.
این فناوری نه تنها یک پیشرفت علمی در زمینه علوم اعصاب و یادگیری ماشین محسوب میشود، بلکه میتواند آیندهی ارتباط انسان و ماشین را تغییر دهد؛ از کمک به افراد دارای محدودیتهای حرکتی گرفته تا ساخت نسل جدیدی از ابزارهای تعامل انسان با هوش مصنوعی.
Brain2Qwerty V2 چیست؟
Brain2Qwerty V2 یک چارچوب مبتنی بر هوش مصنوعی برای رمزگشایی جملات طبیعی از ثبتهای غیرتهاجمی مغزی است.
به زبان ساده، این سیستم تلاش میکند بفهمد زمانی که یک فرد در حال تایپ کردن یک جمله است، چه الگوهایی در فعالیت مغز او ایجاد میشود و چگونه میتوان این الگوها را دوباره به متن تبدیل کرد.
نکتهی مهم در این پروژه این است که مدل برخلاف روشهای قدیمی، فقط به تشخیص لحظهی فشار دادن هر کلید وابسته نیست.
در بسیاری از سیستمهای قبلی، فرآیند رمزگشایی مغز به این شکل بود که:
زمان دقیق فشرده شدن هر کلید مشخص میشد.
سیگنال مغزی اطراف همان لحظه بررسی میشد.
مدل تلاش میکرد مشخص کند چه کلیدی زده شده است.
اما Brain2Qwerty V2 مسیر متفاوتی دارد.
این مدل میتواند یک بازهی پیوسته از سیگنال مغزی MEG را دریافت کند و بدون اینکه آن را بر اساس تکتک کلیدها تقسیم کند، کل جمله را بازسازی کند.
این ویژگی باعث میشود سیستم به شرایط واقعیتر نزدیک شود؛ زیرا در دنیای واقعی، انسانها همیشه با وقفههای دقیق و قابل پیشبینی فکر نمیکنند.
MEG چیست و چرا در این پروژه استفاده شده است؟
یکی از بخشهای اصلی Brain2Qwerty V2 استفاده از دادههای MEG یا Magnetoencephalography است.
MEG یک روش تصویربرداری عصبی غیرتهاجمی است که میدانهای مغناطیسی بسیار ضعیف تولیدشده توسط فعالیت نورونهای مغز را ثبت میکند.
برخلاف روشهایی که نیاز به ورود تجهیزات به بدن دارند، MEG بدون جراحی یا کاشت الکترود انجام میشود.
مزایای MEG عبارتاند از:
ثبت سریع فعالیت مغز
دقت زمانی بالا
امکان بررسی فرآیندهای عصبی مرتبط با زبان
غیرتهاجمی بودن
البته تحلیل دادههای MEG بسیار دشوار است؛ زیرا سیگنالهای مغزی بسیار پیچیده، پرنویز و وابسته به فرد هستند.
اینجاست که یادگیری عمیق وارد میدان میشود.
مدلهای هوش مصنوعی میتوانند الگوهایی را پیدا کنند که با روشهای سنتی تحلیل داده شاید قابل مشاهده نباشند.
معماری Brain2Qwerty V2؛ ترکیب چند فناوری هوش مصنوعی
قدرت اصلی این سیستم از ترکیب چند بخش مختلف هوش مصنوعی ایجاد میشود.
معماری کلی شامل چهار قسمت اصلی است:
رمزگذار Conv + Conformer
سر خروجی CTC
همترازکننده کنتراستیو در سطح کلمه
مدل زبانی بزرگ سازگارشده با LoRA
هر بخش وظیفه خاصی دارد.
۱. رمزگذار Conv + Conformer؛ تبدیل سیگنال مغز به ویژگیهای قابل فهم
اولین مرحله، دریافت داده خام مغزی است.
سیگنال MEG به تنهایی برای یک مدل زبانی قابل استفاده نیست. بنابراین ابتدا باید ویژگیهای مهم آن استخراج شود.
در Brain2Qwerty V2 از ترکیب:
شبکه کانولوشنی (CNN)
معماری Conformer
استفاده شده است.
شبکههای کانولوشنی در شناسایی الگوهای محلی بسیار قدرتمند هستند. آنها میتوانند تغییرات کوتاهمدت در سیگنال مغزی را پیدا کنند.
اما مغز انسان فقط بر اساس الگوهای کوتاه تصمیم نمیگیرد. زبان و تفکر دارای وابستگیهای طولانی هستند.
اینجا معماری Conformer وارد میشود.
Conformer ترکیبی از:
شبکههای کانولوشنی
مکانیزم توجه (Attention)
است.
این معماری ابتدا در پردازش گفتار بسیار موفق بود و اکنون در تحلیل سیگنالهای عصبی نیز استفاده میشود.
۲. CTC؛ تبدیل فعالیت مغز به توالی کاراکترها

بخش دوم مدل، یک سر خروجی مبتنی بر CTC یا Connectionist Temporal Classification است.
CTC یکی از روشهای مهم در پردازش توالیهاست.
مشکل اصلی در دادههای مغزی این است که همیشه مشخص نیست هر بخش از سیگنال دقیقاً مربوط به کدام حرف یا کلمه است.
CTC این مشکل را حل میکند.
به جای اینکه مدل مجبور باشد برای هر لحظه یک کاراکتر مشخص تعیین کند، اجازه میدهد ارتباط بین زمان و خروجی به صورت انعطافپذیر یاد گرفته شود.
در نتیجه مدل میتواند از یک توالی طولانی فعالیت مغزی، یک توالی متنی تولید کند.
۳. یادگیری کنتراستیو؛ نزدیک کردن زبان مغز به زبان انسان
یکی از نوآوریهای مهم Brain2Qwerty V2 استفاده از هدف یادگیری کنتراستیو در سطح کلمه است.
در این روش، مدل تلاش میکند نمایشهای عصبی کلمات را به نمایشهایی که توسط مدل زبانی ساخته میشوند نزدیک کند.
یعنی:
یک نمایش از فعالیت مغزی استخراج میشود.
یک نمایش از همان کلمه توسط مدل زبان ساخته میشود.
مدل یاد میگیرد این دو را به هم مرتبط کند.
این کار باعث میشود فاصله بین سیگنال خام مغز و مفهوم زبانی کاهش پیدا کند.
به بیان سادهتر، مدل فقط دنبال تشخیص شکل حروف نیست؛ بلکه تلاش میکند مفهوم پشت آنها را نیز بهتر درک کند.
۴. مدل زبانی بزرگ و LoRA؛ مرحله تولید جمله طبیعی
پس از استخراج اطلاعات عصبی، نوبت به تولید متن روان میرسد.
در این مرحله از یک مدل زبانی بزرگ (LLM) استفاده میشود.
LLMها همان فناوری پشت بسیاری از سیستمهای هوش مصنوعی مدرن هستند که توانایی تولید متن طبیعی دارند.
اما آموزش کامل یک مدل زبانی بزرگ بسیار پرهزینه است.
برای حل این مشکل، Brain2Qwerty V2 از روش LoRA یا Low-Rank Adaptation استفاده میکند.
LoRA اجازه میدهد مدل زبانی با تعداد بسیار کمتری پارامتر جدید سازگار شود.
در این پروژه:
یک آداپتور LoRA مشترک برای همه افراد استفاده شده است.
رتبه LoRA برابر ۲ است.
همین پیکربندی در مقاله گزارش شده است.
فرآیند آموزش مدل؛ چرا آموزش مرحلهای اهمیت دارد؟
یکی از ویژگیهای مهم Brain2Qwerty V2 برنامه آموزشی مرحلهای آن است.
سه هدف اصلی مدل به صورت همزمان اما در زمانهای مختلف فعال میشوند.
مراحل آموزش:
مرحله اول؛ آموزش CTC
از Epoch صفر، مدل با هدف CTC شروع به یادگیری میکند.
در این مرحله، مدل یاد میگیرد ارتباط اولیه بین سیگنال مغزی و کاراکترها را پیدا کند.
مرحله دوم؛ اضافه شدن یادگیری کنتراستیو
در Epoch 150، بخش کنتراستیو اضافه میشود.
در این مرحله مدل بهتر یاد میگیرد که الگوهای عصبی را با ساختارهای زبانی هماهنگ کند.
مرحله سوم؛ اضافه شدن مدل زبانی
در Epoch 225، مدل زبانی بزرگ وارد فرآیند میشود.
از اینجا مدل میتواند خروجیهای طبیعیتر و شبیهتر به زبان انسان تولید کند.
ساختار پروژه و اجرای کدها
این پروژه با استفاده از PyTorch Lightning توسعه داده شده است.
برای اجرا نیاز به:
Python نسخه 3.10 یا بالاتر
GPU سازگار با CUDA
وجود دارد.
نصب وابستگیها
ابتدا وابستگیهای پروژه نصب میشوند:
pip install -r requirements.lock
سپس پکیج اصلی نصب میشود:
pip install -e . --no-deps
اجرای مراحل اصلی Brain2Qwerty V2
مرحله اول؛ آمادهسازی Cache
برای استخراج اولیه ویژگیها:
python -m brain2qwerty_v2.main cache
این مرحله معمولاً یک بار انجام میشود و بیشتر پردازش آن وابسته به CPU است.
مرحله دوم؛ اجرای تست کوتاه
برای بررسی سلامت پروژه:
python -m brain2qwerty_v2.main debug
این حالت روی یک GPU و یک Timeline اجرا میشود.
مرحله سوم؛ آموزش کامل مدل
اجرای آموزش اصلی:
python -m brain2qwerty_v2.main train
در این مرحله:
CTC از Epoch صفر فعال است.
Contrastive Loss از Epoch 150 اضافه میشود.
LLM از Epoch 225 وارد میشود.
خروجیها:
best_ctc.ckpt
best_llm.ckpt
مرحله چهارم؛ ارزیابی مدل
برای ارزیابی بهترین مدل:
python -m brain2qwerty_v2.main eval --ckpt $BRAIN2QWERTY_RESULTS/best_llm.ckpt
خروجی:
predictions_test.csv
این فایل شامل:
متن واقعی
خروجی CTC
خروجی LLM
برای هر جمله است.
مرحله پنجم؛ استخراج معیارها
برای محاسبه نتایج نهایی:
python -m brain2qwerty_v2.scripts.extract_predictions \
--input $BRAIN2QWERTY_RESULTS/predictions_test.csv --split test
این مرحله:
نتایج هر جمله
میانگین هر فرد
خطای استاندارد بین افراد
را محاسبه میکند.
اهمیت Brain2Qwerty V2 برای آینده انسان و هوش مصنوعی
Brain2Qwerty V2 فقط یک پروژه دانشگاهی نیست؛ بلکه نمونهای از مسیر آینده فناوری است.
در آینده ممکن است رابطهای مغز و کامپیوتر بتوانند:
ارتباط سریعتر انسان با ماشین ایجاد کنند.
به افراد دارای مشکلات حرکتی کمک کنند.
روشهای جدید تعامل با هوش مصنوعی بسازند.
امکان کنترل سیستمها با فکر را فراهم کنند.
البته هنوز فاصله زیادی تا خواندن کامل افکار انسان وجود دارد.
سیگنالهای مغزی بسیار پیچیده هستند و فناوری امروز بیشتر روی فعالیتهای مشخص مانند تصور حرکت، گفتار یا تایپ تمرکز دارد.
اما پیشرفتهایی مانند Brain2Qwerty V2 نشان میدهد مرز میان علوم اعصاب، هوش مصنوعی و مهندسی کامپیوتر روزبهروز کمتر میشود.
جمعبندی
Brain2Qwerty V2 یک قدم مهم در مسیر ساخت نسل جدید رابطهای مغز و کامپیوتر است.
این سیستم با ترکیب:
ثبت غیرتهاجمی مغزی MEG
یادگیری عمیق
معماری Conv + Conformer
CTC
یادگیری کنتراستیو
مدلهای زبانی بزرگ
تکنیک LoRA
توانسته است جملات طبیعی تایپشده را مستقیماً از سیگنالهای مغزی بازسازی کند.
شاید هنوز زمان آن نرسیده باشد که انسان و ماشین کاملاً بدون واسطه ارتباط برقرار کنند، اما پروژههایی مانند Brain2Qwerty V2 نشان میدهند این آینده دیگر فقط یک ایده علمی-تخیلی نیست؛ بلکه به یک مسیر واقعی تحقیقاتی تبدیل شده است.
| برای اطلاعات فنی و دقیق تر و دریافت پروژه اینجا کیک کنید |

