ساخت دستیار هوش مصنوعی سلامت محلی با MedGemma, Ollama و Open WebUI

مقدمه‌ای بر هوش مصنوعی سلامت محلی

در دنیای امروز، داده‌های حوزه سلامت از حساس‌ترین و محرمانه‌ترین اطلاعات محسوب می‌شوند. به همین دلیل، ارسال این داده‌ها به سرویس‌های ابری هوش مصنوعی، اغلب به دلیل الزامات حریم خصوصی و قوانین انطباق‌پذیری سخت‌گیرانه، امکان‌پذیر نیست. این چالش، راه را برای رویکردهای نوین در توسعه هوش مصنوعی سلامت هموار می‌کند که تمرکز بر پردازش و اجرای مدل‌ها به صورت محلی است. ایجاد یک دستیار هوش مصنوعی سلامت که به‌طور کامل بر روی سیستم شخصی شما اجرا شود، نه تنها امنیت داده‌ها را تضمین می‌کند، بلکه انعطاف‌پذیری بی‌نظیری را برای توسعه‌دهندگان فراهم می‌آورد. این رویکرد، دروازه‌ای به سوی ساخت راهکارهای سفارشی در حوزه پزشکی است که می‌تواند در پلتفرم‌های مختلف، از جمله محیط‌های مبتنی بر وب و سیستم‌های مدیریت محتوا، مورد استفاده قرار گیرد. این امکان برای توسعه‌دهندگان و افرادی که به دنبال یادگیری عمیق در این حوزه هستند، فرصتی بی‌نظیر برای آزمایش و پیاده‌سازی فراهم می‌آورد، بدون آنکه نگران نشت اطلاعات حساس باشند.

چرا هوش مصنوعی سلامت محلی حیاتی است؟

اجرای مدل‌های هوش مصنوعی به صورت محلی، به‌ویژه در حوزه سلامت، دلایل قانع‌کننده‌ای دارد که فراتر از راحتی است. اصل حریم خصوصی از طریق معماری، تضمین می‌کند که داده‌های پزشکی، اعم از متون و تصاویر، هرگز دستگاه شما را ترک نمی‌کنند. این ویژگی، ساده‌ترین سناریوی انطباق‌پذیری با مقررات حفظ حریم خصوصی اطلاعات پزشکی (PHI) را ارائه می‌دهد و نگرانی‌ها بابت ثبت API یا پردازش داده توسط شخص ثالث را از بین می‌برد. این رویکرد، به توسعه‌دهندگان امکان می‌دهد تا با آرامش خاطر بیشتری بر روی تجربه کاربری و قابلیت‌های وب‌سایت یا پلتفرم خود تمرکز کنند.

علاوه بر حریم خصوصی، مزایای مهم دیگری نیز وجود دارد:

  • هزینه صفر به ازای هر توکن: پس از دانلود مدل، آزمایش و تکرار بر روی پرامپت‌ها صدها بار بدون هیچ هزینه اضافی امکان‌پذیر است.
  • دسترسی آفلاین: در محیط‌هایی مانند بیمارستان‌ها یا کلینیک‌ها که دسترسی به اینترنت محدود یا قطع است، مدل محلی پس از دانلود اولیه بدون نیاز به اتصال به اینترنت کار می‌کند. این قابلیت می‌تواند در سیستم‌های مدیریت محتوا یا پلتفرم‌های وب که نیاز به پایداری عملکرد دارند، بسیار ارزشمند باشد.
  • کنترل کامل: شما بر روی نسخه مدل کنترل کامل دارید و هیچ‌گونه تغییر غیرمنتظره‌ای در عملکرد مدل رخ نمی‌دهد. این به توسعه‌دهندگان اطمینان می‌دهد که پلتفرم آن‌ها همواره با همان مدل ثابت کار خواهد کرد.
  • فرصت یادگیری: اجرای مدل‌ها به صورت محلی، ابهامات فنی را برطرف کرده و درک عمیق‌تری از مفاهیم مانند پنجره‌های متنی و محدودیت‌های حافظه به دست می‌آید.

MedGemma: مغز متفکر هوش مصنوعی پزشکی

MedGemma مجموعه‌ای از مدل‌های متن‌باز گوگل است که بر پایه معماری Gemma 3 ساخته شده و به طور خاص برای درک متون و تصاویر پزشکی آموزش دیده است. می‌توان آن را به Gemma تشبیه کرد که چهار سال در دانشکده پزشکی و دوره رزیدنسی رادیولوژی را گذرانده است. این مدل، برخلاف مدل‌های عمومی مانند Llama یا Mistral، به‌طور خاص برای کاربردهای مراقبت‌های بهداشتی طراحی شده است و می‌تواند به عنوان یک هسته اصلی برای ایجاد راهکارهای سفارشی در حوزه سلامت مورد استفاده قرار گیرد.

قابلیت‌های برجسته MedGemma شامل موارد زیر است:

  • درک تصاویر پزشکی: مدل‌های چندوجهی آن بر روی تصاویر پزشکی ناشناس، از جمله عکس‌های اشعه ایکس قفسه سینه، تصاویر درماتولوژی، چشم‌پزشکی و پاتولوژی، آموزش دیده‌اند. این ویژگی، آن را به ابزاری قدرتمند برای تحلیل بصری در وب‌سایت‌ها و پلتفرم‌های تشخیص پزشکی تبدیل می‌کند.
  • تخصص در زبان پزشکی: با آموزش بر روی ادبیات پزشکی و مجموعه‌داده‌های پرسش و پاسخ بالینی، MedGemma قادر است اصطلاحات پزشکی و گزارش‌های رادیولوژی را بهتر درک کند.
  • اندازه‌های مختلف مدل: MedGemma در نسخه‌های 4B و 27B در دسترس است که هر دو از ورودی‌های متنی و تصویری با پنجره متنی 128K پشتیبانی می‌کنند.
  • وزن‌های باز: امکان دانلود، اجرا، تنظیم دقیق و ساخت برنامه‌ها با مدل به صورت محلی تحت شرایط استفاده Health AI Developer Foundation وجود دارد. این ویژگی، آن را به گزینه‌ای ایده‌آل برای توسعه‌دهندگان در اکوسیستم‌های متن‌باز تبدیل می‌کند.

MedGemma به عنوان یک مدل پایه برای توسعه‌دهندگان در حال ساخت اپلیکیشن‌های مراقبت‌های بهداشتی، ابزارهای آموزش پزشکی، دستیاران تحقیقاتی، خلاصه‌سازهای گزارش و سایر گردش‌های کاری پزشکی مبتنی بر هوش مصنوعی طراحی شده است.

ابزارهای کلیدی برای راه‌اندازی یک دستیار محلی

ساخت یک دستیار هوش مصنوعی سلامت محلی با استفاده از سه ابزار متن‌باز کلیدی، به راحتی امکان‌پذیر است. این ابزارها با یکدیگر همکاری می‌کنند تا یک پلتفرم کامل و مستقل را برای توسعه‌دهندگان فراهم آورند. این رویکرد به کاربران نهایی نیز امکان می‌دهد تا با یک رابط کاربری مبتنی بر وب، به راحتی با مدل تعامل داشته باشند، که یادآور سادگی سیستم‌های مدیریت محتوا است.

  1. Ollama: این یک زمان اجرای سبک است که دانلود، کوانتیزاسیون و ارائه مدل‌های باز را از طریق یک رابط خط فرمان (CLI) ساده و یک REST API محلی مدیریت می‌کند. Ollama فرایند پیچیده اجرای مدل‌های بزرگ زبان را بر روی سیستم شما به طرز چشمگیری ساده می‌کند و زیرساخت لازم برای تعامل با MedGemma را فراهم می‌سازد. برای توسعه‌دهندگان، این به معنای مدیریت آسان مدل‌ها و تمرکز بر منطق برنامه است.
  2. MedGemma: همانطور که پیشتر ذکر شد، این مدل پزشکی آموزش‌دیده گوگل، قلب تپنده دستیار هوش مصنوعی شما خواهد بود که توانایی درک متون و تصاویر پزشکی را دارد.
  3. Open WebUI: یک رابط کاربری وب به سبک ChatGPT است که برای تعامل با مدل‌های محلی طراحی شده است. این رابط کاربری، شامل تاریخچه گفتگو، امکان سوئیچ بین مدل‌ها، آپلود تصاویر و پشتیبانی از چند کاربر است که همگی به صورت خودمیزبان اجرا می‌شوند. Open WebUI یک تجربه کاربری روان را فراهم می‌کند و به توسعه‌دهندگان کمک می‌کند تا به سرعت یک داشبورد تعاملی برای مدل‌های خود داشته باشند، که می‌تواند پایه‌ای برای ابزارهای آموزشی یا پلتفرم‌های داخلی باشد.

با ترکیب این سه ابزار، می‌توانید یک دستیار هوش مصنوعی پزشکی کامل را بر روی دستگاه خود راه‌اندازی کنید که می‌تواند با مدل هوش مصنوعی دارای تنظیمات پزشکی گفتگو کند، تصاویر پزشکی مانند عکس‌های اشعه ایکس قفسه سینه را برای تجزیه و تحلیل آپلود نماید و همه این کارها را به صورت محلی و بدون ارسال داده‌های شما به فضای ابری انجام دهد. ذکر این نکته حائز اهمیت است که MedGemma یک مدل توسعه‌دهنده است، نه یک دستگاه پزشکی. خروجی‌های آن به هیچ وجه نباید به طور مستقیم برای تشخیص بالینی، مدیریت بیمار یا تصمیمات درمانی مورد استفاده قرار گیرند. هر آنچه در این راهنما ساخته می‌شود، صرفاً برای اهداف یادگیری، نمونه‌سازی و تحقیق است. همیشه برای سوالات پزشکی واقعی با متخصصان واجد شرایط مشاوره کنید. این هشدار، برای حفظ سلامت و ایمنی کاربران نهایی بسیار حیاتی است.

آشنایی با MedGemma, Ollama و Open WebUI

در عصر حاضر که هوش مصنوعی به سرعت در حال پیشرفت است، نیاز به ابزارهای قدرتمند و در عین حال خصوصی، به ویژه در حوزه‌های حساس مانند مراقبت‌های بهداشتی، بیش از پیش احساس می‌شود. اطلاعات پزشکی از جمله حساس‌ترین داده‌ها محسوب می‌شوند و ارسال آن‌ها به سرویس‌های هوش مصنوعی ابری اغلب به دلیل الزامات حفظ حریم خصوصی و قوانین انطباق، امکان‌پذیر نیست. اینجاست که راه‌حل‌های محلی مانند MedGemma, Ollama و Open WebUI وارد عمل می‌شوند. این ابزارها به شما امکان می‌دهند تا یک دستیار هوش مصنوعی پزشکی بسازید که به طور کامل روی سیستم خودتان اجرا می‌شود و کنترل کامل بر داده‌ها و عملکرد آن را فراهم می‌آورد.

MedGemma: هوش مصنوعی پزشکی قدرتمند گوگل

MedGemma مجموعه‌ای از مدل‌های متن‌باز گوگل است که بر پایه معماری Gemma 3 بنا شده و به طور خاص برای درک متن و تصاویر پزشکی آموزش دیده است. می‌توان آن را به عنوان مدل Gemma تصور کرد که چهار سال دانشکده پزشکی و رزیدنسی رادیولوژی را پشت سر گذاشته است. برخلاف مدل‌های عمومی‌تر مانند Llama یا Mistral، MedGemma به طور ویژه برای کاربردهای مراقبت‌های بهداشتی طراحی شده و مزایای قابل توجهی دارد:

  • درک تصویر پزشکی: مدل‌های چندوجهی آن با تصاویر پزشکی ناشناس، از جمله رادیوگرافی قفسه سینه، تصاویر درماتولوژی، چشم‌پزشکی و پاتولوژی آموزش دیده‌اند. این قابلیت، آن را به ابزاری بی‌نظیر برای تفسیر تصاویر بالینی تبدیل می‌کند.
  • تخصص در زبان پزشکی: این مدل بر روی ادبیات پزشکی و مجموعه‌داده‌های پرسش و پاسخ بالینی آموزش دیده است، که امکان درک بهتر اصطلاحات پزشکی و گزارش‌های رادیولوژی را فراهم می‌کند.
  • اندازه‌های مختلف مدل: MedGemma در دو نسخه 4B و 27B موجود است که هر دو از ورودی‌های متنی و تصویری با پنجره زمینه 128K پشتیبانی می‌کنند. این تنوع به توسعه‌دهندگان امکان می‌دهد تا بر اساس نیازهای سخت‌افزاری و کاربردی خود انتخاب کنند.
  • وزن‌های متن‌باز: شما می‌توانید مدل را به صورت محلی دانلود، اجرا، بهینه‌سازی (fine-tune) و با رعایت شرایط استفاده Health AI Developer Foundation، با آن برنامه‌سازی کنید. این ویژگی برای توسعه‌دهندگان، همانند دسترسی به کد یک افزونه وردپرس، آزادی عمل بسیاری می‌دهد.

هدف MedGemma ارائه یک مدل پایه برای توسعه‌دهندگانی است که در حال ساخت برنامه‌های کاربردی مراقبت‌های بهداشتی، ابزارهای آموزش پزشکی، دستیاران تحقیقاتی و سایر گردش‌کارهای پزشکی مبتنی بر هوش مصنوعی هستند. این رویکرد، حریم خصوصی را با معماری محلی تضمین می‌کند؛ به این معنی که اطلاعات پزشکی و تصاویر هرگز دستگاه شما را ترک نمی‌کنند. این ساده‌ترین راه برای حفظ انطباق با قوانین حریم خصوصی داده‌ها، مانند داده‌های محافظت‌شده بهداشتی (PHI) است.

نقش Ollama و Open WebUI در راه‌اندازی محلی

برای راه‌اندازی یک دستیار هوش مصنوعی پزشکی کامل به صورت محلی، علاوه بر MedGemma به دو ابزار متن‌باز دیگر نیاز دارید: Ollama و Open WebUI.

  • Ollama: این یک زمان اجرای سبک وزن است که مدیریت دانلود، کوانتیزه‌سازی (quantization) و سرویس‌دهی مدل‌های متن‌باز را از طریق یک رابط خط فرمان (CLI) ساده و یک REST API محلی بر عهده دارد. Ollama به شما امکان می‌دهد تا به راحتی مدل‌هایی مانند MedGemma را بر روی سیستم عامل‌های مختلف از جمله macOS، Linux و Windows نصب و اجرا کنید.
  • Open WebUI: این ابزار یک رابط کاربری وب زیبا و شبیه ChatGPT را در بالای Ollama فراهم می‌کند. با Open WebUI می‌توانید تاریخچه مکالمات خود را مدیریت کنید، بین مدل‌های مختلف سوئیچ کنید، تصاویر را آپلود کرده و از پشتیبانی چند کاربره بهره‌مند شوید؛ همگی به صورت خودمیزبان. این رابط، تعامل با مدل‌های محلی را بسیار آسان‌تر و کاربرپسندتر می‌کند و نیاز به دانش عمیق از خط فرمان را کاهش می‌دهد. پیکربندی این رابط می‌تواند به سادگی پیکربندی یک محیط توسعه برای وردپرس باشد.

با ترکیب این سه ابزار، شما یک محیط توسعه کامل برای هوش مصنوعی پزشکی خود ایجاد می‌کنید. داده‌ها هرگز از پایگاه داده محلی شما خارج نمی‌شوند، هزینه به ازای هر توکن صفر است (پس از دانلود مدل، آزمایش‌ها رایگان هستند)، و حتی در شبکه‌های محدود یا بدون اینترنت نیز دسترسی آفلاین خواهید داشت. این کنترل کامل به شما اجازه می‌دهد تا نسخه مدل را انتخاب و آن را پین کنید تا بدون اطلاع شما تغییر نکند. این تجربه عملی به شما درک بهتری از پنجره‌های زمینه، کوانتیزه‌سازی و محدودیت‌های حافظه می‌دهد که با فراخوانی API به سادگی به دست نمی‌آید.

نکات کلیدی و عیب‌یابی برای راه‌اندازی

برای شروع کار با این ابزارها، نیازمندی‌های سخت‌افزاری و نرم‌افزاری خاصی وجود دارد. حداقل 8 گیگابایت رم (16 گیگابایت توصیه می‌شود) برای مدل MedGemma 4B و 32 گیگابایت رم یا یک GPU با 24 گیگابایت VRAM یا بیشتر برای مدل 27B مورد نیاز است. همچنین حدود 15 گیگابایت فضای خالی دیسک توصیه می‌شود. از نظر نرم‌افزاری، سیستم‌عامل macOS، Linux یا Windows 10/11، Docker Desktop (برای نصب Open WebUI به روش توصیه شده) یا Python 3.11 و آشنایی ابتدایی با ترمینال کافی است. نیازی به کلید API، حساب کاربری یا اعتبار ابری GPU نیست.

در حین پیکربندی ممکن است با برخی خطاها مواجه شوید. یکی از رایج‌ترین مشکلات MedGemma، خطای “does not support tools” است. این بدان معناست که Open WebUI در حال ارسال تعاریف ابزار/تابع بومی با درخواست شماست، در حالی که MedGemma از API ابزارهای Ollama پشتیبانی نمی‌کند. برای حل این مشکل، باید قابلیت‌های Builtin Tools، Web Search، Code Interpreter و Terminal را در تنظیمات مدل MedGemma در پنل مدیریت Open WebUI غیرفعال کنید. اطمینان حاصل کنید که فقط Vision، File Upload و File Context فعال باشند. در صورت عدم نمایش مدل‌ها در منوی کشویی Open WebUI، باید اتصال Ollama را بررسی کنید و مطمئن شوید که آدرس API به درستی تنظیم شده باشد (http://host.docker.internal:11434 برای Docker و http://localhost:11434 برای نصب pip).

اگر پاسخ‌ها به شدت کند هستند، با استفاده از دستور `ollama ps` وضعیت رم/VRAM را بررسی کنید. اگر مدل درصد بالایی از CPU را نشان می‌دهد، به این معنی است که در GPU/حافظه یکپارچه شما جای نمی‌گیرد و باید به مدل 4B سوئیچ کنید. همچنین، بستن برنامه‌های پرمصرف می‌تواند کمک کننده باشد. این مراحل عیب‌یابی به شما کمک می‌کند تا یک دستیار هوش مصنوعی پزشکی خصوصی و کارآمد را روی سیستم محلی خود مستقر کنید و از قابلیت‌های بی‌نظیر آن در زمینه‌های مختلف پزشکی بهره‌مند شوید.

راهنمای نصب و راه‌اندازی گام به گام

در دنیای امروز که حفاظت از حریم خصوصی داده‌ها، به‌ویژه در حوزه حساس سلامت، از اهمیت بالایی برخوردار است، راه‌اندازی یک دستیار هوش مصنوعی پزشکی به‌صورت محلی راهکاری ایده‌آل محسوب می‌شود. این راهنمای جامع به شما کمک می‌کند تا با استفاده از سه ابزار قدرتمند متن‌باز، یعنی MedGemma، Ollama و Open WebUI، یک دستیار هوش مصنوعی پزشکی را به‌طور کامل روی سیستم خود نصب و راه‌اندازی کنید. این رویکرد تضمین می‌کند که تمامی داده‌های حساس شما روی دستگاه خودتان باقی بمانند و هرگز به فضای ابری ارسال نشوند، که برای توسعه‌دهندگان و پژوهشگران فعال در هوش مصنوعی پزشکی حیاتی است.

پیش‌نیازهای سخت‌افزاری و نرم‌افزاری

قبل از شروع فرآیند نصب، اطمینان از آماده بودن سیستم شما ضروری است. این بخش به تفصیل به پیش‌نیازهای سخت‌افزاری و نرم‌افزاری لازم برای راه‌اندازی موفقیت‌آمیز MedGemma با Ollama و Open WebUI می‌پردازد:

  • سخت‌افزار: برای مدل MedGemma 4B، حداقل 8 گیگابایت رم (16 گیگابایت توصیه می‌شود) نیاز است که حدود 3.3 گیگابایت دانلود خواهد داشت. اگر قصد اجرای مدل قدرتمندتر MedGemma 27B را دارید، به 32 گیگابایت رم یا یک GPU با حداقل 24 گیگابایت VRAM نیاز دارید؛ حجم این مدل حدود 17 گیگابایت است. همچنین، حدود 15 گیگابایت فضای خالی دیسک برای مدل‌ها، ایمیج‌های داکر و فضای کاری توصیه می‌شود. مک‌های با تراشه Apple Silicon (M1 تا M4) عملکرد بسیار خوبی در این زمینه دارند، زیرا Ollama به طور خودکار از شتاب‌دهنده Metal استفاده می‌کند. برای ویندوز و لینوکس، وجود GPU انویدیا بسیار کمک‌کننده است، اما اجباری نیست و مدل می‌تواند روی CPU نیز اجرا شود، اگرچه کندتر خواهد بود.

  • نرم‌افزار: شما به سیستم‌عامل macOS، Linux یا Windows 10/11 نیاز دارید. برای نصب Open WebUI (که توصیه می‌شود) باید Docker Desktop را نصب کنید. در غیر این صورت، می‌توانید از Python 3.11 برای نصب Open WebUI از طریق pip استفاده کنید. آشنایی اولیه با محیط ترمینال نیز مفید خواهد بود. برای شروع نیازی به کلیدهای API، حساب کاربری یا اعتبار ابری GPU نخواهید داشت.

نصب Ollama و دانلود MedGemma

Ollama به عنوان یک محیط اجرایی سبک، وظیفه دانلود، کوانتیزاسیون و ارائه مدل‌های متن‌باز را از طریق یک CLI ساده و یک REST API محلی بر عهده دارد.

  • نصب Ollama: برای macOS، می‌توانید برنامه را از ollama.com/download دانلود کرده یا از Homebrew استفاده کنید: brew install ollama. برای Linux، دستور curl -fsSL https://ollama.com/install.sh | sh و برای ویندوز، دانلود نصب‌کننده بومی از همان وب‌سایت و اجرای آن کافی است. پس از نصب، با دستور ollama --version از صحت نصب اطمینان حاصل کنید. Ollama یک سرویس پس‌زمینه را روی http://localhost:11434 راه‌اندازی می‌کند که Open WebUI در ادامه با آن ارتباط برقرار خواهد کرد.

  • دریافت MedGemma: MedGemma مستقیماً در کتابخانه رسمی مدل‌های Ollama موجود است. برای دانلود مدل پیش‌فرض 4B کافیست دستور ollama pull medgemma را اجرا کنید. این مدل چندوجهی حدود 3.3 گیگابایت حجم دارد. برای دانلود نسخه 27B که نیاز به سخت‌افزار قدرتمندتری دارد، از ollama pull medgemma:27b استفاده کنید. پس از اتمام دانلود، با ollama list از نصب صحیح مدل اطمینان حاصل کنید.

  • تست MedGemma از ترمینال: قبل از اضافه کردن رابط کاربری، می‌توانید با دستور ollama run medgemma یک جلسه تعاملی در ترمینال آغاز کرده و سوالات پزشکی خود را مطرح کنید. این گام اطمینان می‌دهد که مدل به درستی کار می‌کند و پاسخ‌هایی تخصصی مانند علائم رادیوگرافیک ذات‌الریه یا تفاوت دیابت نوع 1 و 2 را ارائه می‌دهد. همچنین می‌توانید تصاویر پزشکی را مستقیماً از طریق ترمینال با مشخص کردن مسیر فایل آزمایش کنید.

راه‌اندازی Open WebUI برای تعامل بصری

Open WebUI یک رابط کاربری زیبا و کاربرپسند شبیه به ChatGPT را بر روی Ollama فراهم می‌کند که شامل تاریخچه مکالمه، تعویض مدل، بارگذاری تصاویر و پشتیبانی چندکاربره است.

  • نصب با Docker (توصیه شده): Docker Desktop را نصب و اجرا کنید. سپس، Open WebUI را با دستور زیر راه‌اندازی کنید: docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main. این دستور کانتینر را در پس‌زمینه اجرا می‌کند، پورت 3000 سیستم شما را به پورت 8080 وب‌سایت نگاشت می‌کند و به کانتینر اجازه می‌دهد به سرور Ollama روی ماشین میزبان دسترسی پیدا کند.

  • نصب با pip (بدون Docker): اگر مایل به استفاده از Docker نیستید، می‌توانید Open WebUI را به عنوان یک بسته پایتون (نسخه 3.11) نصب کنید: pip install open-webui و سپس با open-webui serve آن را اجرا کنید. این روش رابط کاربری را در http://localhost:8080 راه‌اندازی می‌کند.

اتصال Open WebUI به Ollama و شروع مکالمه

پس از نصب Open WebUI، مرورگر خود را باز کرده و به آدرس http://localhost:3000 (یا :8080 اگر از pip استفاده کرده‌اید) بروید. در اولین راه‌اندازی، از شما خواسته می‌شود یک حساب کاربری ادمین ایجاد کنید که به‌صورت محلی ذخیره می‌شود. در بیشتر موارد، Open WebUI به طور خودکار Ollama را در http://localhost:11434 شناسایی می‌کند. اگر مدل‌های شما ظاهر نشدند، اتصال را به صورت دستی در پنل ادمین، بخش تنظیمات و اتصالات، پیکربندی کنید. برای نصب Docker، آدرس http://host.docker.internal:11434 و برای نصب pip، http://localhost:11434 را وارد کنید.

اکنون می‌توانید از طریق Open WebUI با MedGemma چت کنید. مدل MedGemma را از منوی کشویی انتخاب کرده و مکالمه را آغاز کنید. به عنوان مثال، می‌توانید یک گزارش رادیولوژی را بارگذاری کرده و از MedGemma بخواهید آن را به زبانی ساده برای بیمار توضیح دهد. این قابلیت ترجمه زبان بالینی به زبان عامیانه یکی از نقاط قوت MedGemma است. همچنین، این ابزار امکان بارگذاری و تحلیل تصاویر پزشکی مانند عکس‌های رادیولوژی قفسه سینه، ضایعات پوستی و عکس‌های فوندوس چشم را فراهم می‌کند. اطمینان حاصل کنید که از فرمت‌های تصویری استاندارد (PNG، JPEG) استفاده می‌کنید و هرگز تصاویر حاوی اطلاعات شناسایی بیمار را بارگذاری نکنید، مگر اینکه داده‌ها به درستی ناشناس شده باشند. این تمرین حفظ حریم خصوصی داده‌ها، حتی در محیط محلی، بسیار مهم است.

مدیریت مدل‌های بزرگتر و رفع خطاهای رایج

مدل 4B MedGemma برای بسیاری از کارها کارآمد است، اما مدل 27B قدرت بیشتری در استدلال‌های پیچیده‌تر بالینی و تفسیر گزارش‌های دقیق‌تر دارد. برای اجرای مدل 27B، نیاز به سخت‌افزار قدرتمندتری دارید (32 گیگابایت رم یا 24 گیگابایت VRAM). با ollama ps می‌توانید میزان استفاده از رم/VRAM را بررسی کنید. در صورت بروز خطاهایی مانند “registry.ollama.ai/library/medgemma:latest does not support tools”، به پنل ادمین Open WebUI بروید، مدل MedGemma را انتخاب کرده و قابلیت‌هایی مانند Builtin Tools، Web Search، Code Interpreter و Terminal را غیرفعال کنید و فقط Vision، File Upload و File Context را فعال نگه دارید. این خطا معمولاً به دلیل ارسال قابلیت‌های ابزار محلی به مدلی است که از آن‌ها پشتیبانی نمی‌کند. در صورت کندی پاسخ‌ها، اطمینان حاصل کنید که مدل بر روی GPU/unified memory شما قرار دارد و نه فقط CPU، و برنامه‌های پرمصرف حافظه را ببندید. این رویکرد گام به گام تضمین می‌کند که شما یک دستیار هوش مصنوعی پزشکی کامل، خصوصی و قدرتمند را در اختیار خواهید داشت.

تعامل با دستیار و تحلیل تصاویر پزشکی

پس از راه‌اندازی دستیار هوش مصنوعی پزشکی محلی با MedGemma، Ollama و Open WebUI، مرحله کلیدی تعامل مؤثر با آن آغاز می‌شود. این پلتفرم با تمرکز بر حریم خصوصی داده‌ها، قابلیت‌های قدرتمندی در پردازش زبان طبیعی و تحلیل تصاویر پزشکی ارائه می‌دهد. در این بخش، نحوه آغاز مکالمه، بهره‌گیری از ویژگی‌های رابط کاربری و روش‌های تحلیل تصاویر پزشکی را بررسی خواهیم کرد تا بهینه‌سازی کاربری را تضمین کنیم.

آغاز مکالمه و بهره‌برداری از قابلیت‌های متنی

رابط کاربری Open WebUI تجربه‌ای مشابه چت‌بات‌های عمومی را فراهم می‌کند، اما تمام پردازش‌ها روی سیستم شما و به‌صورت محلی انجام می‌شود. برای آغاز، مدل “medgemma” را از فهرست کشویی انتخاب کنید. MedGemma در ترجمه زبان تخصصی پزشکی به زبانی ساده و قابل فهم برای عموم بسیار توانمند است. مثلاً، می‌توانید یک گزارش رادیولوژی پیچیده را ارائه داده و از دستیار بخواهید آن را به زبانی که یک بیمار درک کند، خلاصه نماید.

Open WebUI چندین ویژگی کاربردی برای بهبود تعامل ارائه می‌دهد:

  • پراپت‌های سیستمی: با تنظیم یک پراپت سیستمی (مانند “شما یک دستیار آموزش پزشکی هستید”) می‌توانید نقش و سبک پاسخ‌دهی دستیار را مشخص کنید.
  • تاریخچه مکالمات: تمامی چت‌ها به‌صورت محلی ذخیره و قابل جستجو هستند، که امکان مدیریت محتوای سوابق را فراهم می‌آورد.
  • مقایسه مدل‌ها: امکان اضافه کردن و مقایسه پاسخ‌های مدل‌های مختلف Ollama به سؤالات پزشکی مشابه فراهم است.

تحلیل تصاویر پزشکی با دستیار MedGemma

قابلیت MedGemma در درک و تحلیل تصاویر پزشکی، آن را از مدل‌های عمومی متمایز می‌کند. این مدل بر روی تصاویر پزشکی ناشناس آموزش دیده است. برای آپلود و تحلیل یک تصویر:

  1. یک چت جدید با مدل medgemma شروع کنید.
  2. بر روی آیکون + در کادر پیام کلیک کرده یا فایل تصویری را مستقیماً بکشید و رها کنید.
  3. یک پراپت در کنار تصویر اضافه کنید تا وظیفه‌ای مشخص برای تحلیل تصویر تعیین نمایید.

برای آزمایش این ویژگی، از تصاویر نمونه عمومی مانند NIH ChestX-ray14 استفاده کنید. با آپلود یک تصویر اشعه ایکس قفسه سینه و یک پراپت جهت توصیف سیستماتیک (مانند توصیف کیفیت فنی، ریه‌ها، قلب و استخوان‌ها)، MedGemma توضیحی ساختاریافته و جامع ارائه خواهد داد.

ملاحظات مهم برای آپلود تصاویر:

  • Open WebUI و Ollama با فرمت‌های استاندارد PNG و JPEG سازگارند؛ فایل‌های DICOM بالینی باید تبدیل شوند.
  • هرگز تصاویر حاوی اطلاعات شناسایی بیمار را آپلود نکنید، مگر اینکه کاملاً ناشناس‌سازی شده باشند. این رویه حتی در محیط‌های محلی نیز حیاتی است.

تکنیک‌های پراپت‌نویسی برای بهینه‌سازی تعامل

برای دستیابی به بهترین نتایج از MedGemma، طراحی دقیق پراپت‌ها ضروری است. پراپت‌های مؤثر، به مدل یک نقش مشخص، یک ساختار معین و محدودیت‌های واضح می‌دهند. این رویکرد به بهینه‌سازی خروجی و افزایش دقت پاسخ‌ها کمک می‌کند، که در حوزه پزشکی از اهمیت بالایی برخوردار است.

برخی از نمونه‌های پراپت برای نمایش توانایی‌های MedGemma عبارتند از:

  • آموزش پزشکی: “یک جدول مقایسه‌ای از ACE inhibitors و ARBs ایجاد کنید: مکانیسم، مثال‌های رایج، عوارض جانبی کلیدی و موارد منع مصرف.”
  • مستندسازی بالینی: “این یادداشت‌های کوتاه کلینیک را به یک یادداشت SOAP ساختاریافته تبدیل کنید: ’45F, 3d cough + fever 101F, no SOB, lungs clear, likely viral URI, supportive care, return if worse’.”
  • تحلیل تصویر (با عکس پوستی آپلود شده): “این ضایعه پوستی را با استفاده از معیارهای ABCDE توصیف کنید.”
  • استدلال افتراقی: “یک فرد ۶۰ ساله با کاهش ناگهانی و بدون درد بینایی در یک چشم مراجعه می‌کند. ۵ تشخیص افتراقی برتر و ویژگی‌های متمایزکننده هر یک را فهرست کنید.”

با پیاده‌سازی این رویکردهای پراپت‌نویسی، می‌توانید پتانسیل کامل دستیار هوش مصنوعی MedGemma را برای اهداف آموزشی و پژوهشی در حوزه سلامت آزاد کنید و کارایی آن را در مدیریت فعالیت‌های خود افزایش دهید.

نکات پیشرفته و عیب‌یابی

پس از نصب و راه‌اندازی اولیه دستیار هوش مصنوعی پزشکی خود با MedGemma، Ollama و Open WebUI، ممکن است بخواهید به قابلیت‌های پیشرفته‌تر دسترسی پیدا کنید یا با چالش‌هایی در حین استفاده مواجه شوید. این بخش به شما کمک می‌کند تا مدل‌های بزرگتر را مدیریت کنید و رایج‌ترین مشکلات را عیب‌یابی نمایید تا تجربه کاربری روان و بهینه‌ای داشته باشید.

استفاده از مدل‌های بزرگتر MedGemma برای تحلیل عمیق‌تر

مدل 4B MedGemma با توجه به حجم کم خود، عملکرد چشمگیری ارائه می‌دهد، اما برای استدلال‌های پیچیده‌تر بالینی، تشخیص‌های افتراقی طولانی‌تر، و تفسیر دقیق‌تر گزارش‌ها، مدل 27B به طور قابل توجهی قوی‌تر است. البته این قدرت بیشتر، نیازمند سخت‌افزار قوی‌تری نیز هست.

مدل MedGemma:4b با حجم 3.3 گیگابایت، حداقل 8 گیگابایت رم نیاز دارد و برای لپ‌تاپ‌ها و پاسخ‌های سریع و پرسش و پاسخ تصویری مناسب است. در مقابل، مدل MedGemma:27b با حجم 17 گیگابایت، به حداقل 32 گیگابایت رم یا 24 گیگابایت VRAM (رم کارت گرافیک) احتیاج دارد و برای استدلال عمیق و موارد پیچیده پزشکی ایده‌آل است. برای دانلود و اجرای مدل 27B، کافی است از دستورات ollama pull medgemma:27b و سپس ollama run medgemma:27b استفاده کنید.

نکات عملی برای مدیریت مدل‌های بزرگتر شامل موارد زیر است: با اجرای دستور ollama ps، میزان رم/VRAM مصرفی مدل و محل اجرای آن (GPU، CPU یا ترکیبی) را مشاهده کنید. مدلی که از GPU به CPU منتقل می‌شود، به شدت کند خواهد شد. برای آزادسازی سریع رم بین مدل‌ها، می‌توانید از دستور ollama stop medgemma:27b استفاده کنید. همچنین، سرعت تولید پاسخ را ارزیابی کنید؛ اگر مدل 27B فقط 2-3 توکن در ثانیه تولید می‌کند، شاید مدل 4B با 30+ توکن در ثانیه گزینه بهتری برای شما باشد. می‌توانید هر دو مدل را نصب کرده و به راحتی در رابط Open WebUI بین آن‌ها جابجا شوید.

راهنمای عیب‌یابی مشکلات متداول

در این بخش به بررسی رایج‌ترین مشکلاتی که ممکن است هنگام کار با MedGemma، Ollama و Open WebUI با آن‌ها روبرو شوید و راه‌حل‌های عملی برای رفع آن‌ها می‌پردازیم.

خطای “registry.ollama.ai/library/medgemma:latest does not support tools”

این رایج‌ترین خطای مربوط به MedGemma است و به این معنی است که Open WebUI درخواستی را با تعاریف ابزار/تابع ارسال می‌کند که MedGemma (مانند Gemma 3 پایه) از API ابزارهای Ollama پشتیبانی نمی‌کند. برای رفع این مشکل، باید ابزارهای داخلی را در تنظیمات Open WebUI غیرفعال کنید. ابتدا به Admin Panel > Settings > Models > medgemma بروید و گزینه‌های Builtin Tools, Web Search, Code Interpreter و Terminal را در بخش Capabilities غیرفعال کنید، در حالی که Vision, File Upload و File Context فعال بمانند. همچنین اطمینان حاصل کنید که Task Model محلی یا خارجی روی MedGemma تنظیم نشده باشد و حالت Function Calling در Advanced Params مدل و تنظیمات کاربر روی Default باشد، نه Native. در نهایت، هر تابع سراسری فعال را در Admin Panel > Functions غیرفعال کنید و مطمئن شوید که گزینه‌های جستجوی وب و مفسر کد در باکس پیام هر چت جدید خاموش هستند.

عدم نمایش مدل‌ها در Open WebUI

اگر مدل‌ها در لیست کشویی Open WebUI ظاهر نمی‌شوند، احتمالا ظرفیت Open WebUI قادر به برقراری ارتباط با Ollama نیست. ابتدا مطمئن شوید که Ollama در حال اجرا است؛ می‌توانید با دستور curl http://localhost:11434 بررسی کنید که آیا پاسخ “Ollama is running” را دریافت می‌کنید. سپس، URL اتصال را در Admin Panel > Settings > Connections بررسی کنید. اگر از Docker استفاده می‌کنید، URL باید http://host.docker.internal:11434 باشد، زیرا localhost در داخل کانتینر به خود کانتینر اشاره دارد. در لینوکس، اگر host.docker.internal حل نشد، می‌توانید --network=host را به دستور docker run خود اضافه کرده و از http://localhost:11434 استفاده کنید.

پیام “model not found” هنگام pull کردن MedGemma

این خطا معمولاً به دلیل نیاز MedGemma به نسخه جدیدی از Ollama رخ می‌دهد. برای رفع آن، Ollama را به‌روزرسانی کنید. می‌توانید نصاب را مجدداً اجرا کرده یا در macOS، روی آیکون نوار منو کلیک کرده و سپس Update را انتخاب کنید و سپس مجدداً دستور pull را امتحان کنید.

پاسخ‌های بسیار کند مدل

کند بودن پاسخ‌ها اغلب نشانه‌ای از عدم تناسب مدل با رم/VRAM موجود در دستگاه شماست و مدل به میزان زیادی از CPU استفاده می‌کند. با دستور ollama ps می‌توانید درصد استفاده CPU را بررسی کنید. در این صورت، توصیه می‌شود به مدل 4B برگردید یا برنامه‌های حافظه‌بر، مانند مرورگرهایی با تعداد زیاد تب، را ببندید. همچنین به خاطر داشته باشید که در اولین پیام، مدل برای بارگذاری در حافظه به چند ثانیه زمان نیاز دارد و پیام‌های بعدی بسیار سریع‌تر خواهند بود.

مشکل در آپلود یا نادیده گرفتن تصاویر

برای اطمینان از عملکرد صحیح آپلود تصاویر، موارد زیر را بررسی کنید: مطمئن شوید که مدل MedGemma (چندوجهی) و نه یک مدل فقط متنی را در لیست کشویی انتخاب کرده‌اید. از فرمت‌های تصویری استاندارد مانند PNG یا JPEG استفاده کنید؛ فایل‌های DICOM باید ابتدا تبدیل شوند. تصاویر با وضوح بسیار بالا می‌توانند مشکلاتی ایجاد کنند، بنابراین آن‌ها را قبل از آپلود به اندازه‌ای منطقی (مثلاً 1024 پیکسل در طولانی‌ترین ضلع) تغییر اندازه دهید.

پورت 3000 در حال استفاده است

اگر پورت 3000 در سیستم شما از قبل توسط برنامه دیگری اشغال شده است، می‌توانید پورت میزبان متفاوتی را برای Open WebUI نگاشت کنید. برای این کار، در دستور docker run، عبارت -p 3000:8080 را به -p 3001:8080 تغییر دهید و سپس از طریق آدرس http://localhost:3001 به رابط کاربری دسترسی پیدا کنید.

خطای “Out of memory” هنگام بارگذاری مدل 27B

این خطا به این معنی است که دستگاه شما به اندازه کافی رم یا VRAM آزاد برای بارگذاری مدل 27B ندارد. در این شرایط، بهترین گزینه این است که به مدل MedGemma:4b پایبند باشید، یا حافظه بیشتری را آزاد کنید و دوباره امتحان کنید. مدل 4B به خوبی از ظرفیت خود فراتر رفته و عملکرد قابل قبولی ارائه می‌دهد.

جمع‌بندی و توصیه‌های نهایی این مقاله

در این راهنما، شما گام‌به‌گام یک دستیار هوش مصنوعی پزشکی کامل و خصوصی را از پایه ساختید. با نصب Ollama و دانلود MedGemma، یک مدل چندوجهی آموزش‌دیده پزشکی، آن را روی دستگاه خود اجرا کردید. سپس با استفاده از Open WebUI یک رابط کاربری چت کامل را روی آن قرار دادید و قابلیت‌های مدل را به درستی پیکربندی کردید تا ویژگی‌های فراخوانی ابزار، که مدل از آن پشتیبانی نمی‌کند، باعث بروز خطا نشوند. شما با مدلی چت کردید که گزارش‌های رادیولوژی، اصطلاحات بالینی، و تصاویر پزشکی را درک می‌کند و همچنین توانستید تصاویر را برای تحلیل آپلود کنید. در طول مسیر، نحوه ارتقا به مدل 27B و تشخیص رایج‌ترین خطاها را آموختید.

اکنون شما یک دستیار هوش مصنوعی کاملاً خصوصی دارید که به طور کامل روی دستگاه شما اجرا می‌شود. از اینجا، می‌توانید آن را با تکنیک‌های تولید افزایش‌یافته با بازیابی (RAG) گسترش دهید، آن را با پایپ‌لاین‌های تصویربرداری پزشکی یکپارچه کنید، یا آن را به مجموعه‌های داده بالینی ناشناس متصل کنید تا برنامه‌های هوش مصنوعی پیشرفته‌تری در حوزه سلامت بسازید. این رویکرد نه تنها امنیت داده‌های حساس پزشکی را تضمین می‌کند، بلکه انعطاف‌پذیری و کنترل کاملی بر روی مدل و داده‌های شما فراهم می‌آورد. به سوی ساخت و توسعه برنامه‌های خلاقانه در حوزه سلامت با هوش مصنوعی!

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

پیمایش به بالا