راهنمای عملی برای محصول و توسعه
راهنمای جستجوی فارسی سایت: از نیمفاصله تا غلط تایپی
جستجوی فارسی با گذاشتن یک فیلد متن در دیتابیس تمام نمیشود. تفاوت «ی» و «ک» عربی و فارسی، نیمفاصله، شکل اعداد، جمع بستن کلمات و خطاهای تایپی میتواند محصولی موجود را از دید کاربر پنهان کند. این راهنما یک چکلیست عملی برای ساخت و سنجش جستجوی فارسی در فروشگاه، دانشنامه یا کاتالوگ است.
چرا یک نتیجهٔ فارسی پیدا نمیشود؟
تصور کنید عنوان کالا «کالای ایرانی» است، اما کاربر آن را با حروف عربی مانند «كالاى ايرانى» وارد میکند. از نگاه انسان این دو عبارت یکیاند؛ ولی مقایسهٔ رشتهٔ خام آنها را متفاوت میبیند. همین مسئله برای ارقام فارسی، عربی و لاتین، فاصلههای اضافی و نیمفاصله هم رخ میدهد. نام محصولی مثل «آیفونها» ممکن است به صورت «آیفون ها»، «آیفونها» یا فقط «آیفون» جستجو شود.
راه درست، حذف کورکورانهٔ کاراکترها نیست. باید یک شکل استاندارد برای ایندکس و کوئری بسازید و در عین حال اطلاعاتی را که برای معنی لازم است نگه دارید. برای نمونه، عدد و اعشار در مشخصات محصول معنی دارند؛ ولی نقطهگذاری تزئینی و فاصلههای تکراری معمولاً نباید باعث عدم تطابق شوند.
نرمالسازی باید در هر دو سمت یکسان باشد
یک تابع نرمالسازی ثابت را هم هنگام ورود سند و هم هنگام دریافت عبارت جستجو اجرا کنید. حداقل این موارد را آزمایش کنید:
- تبدیل «ي» و «ى» به «ی»، و «ك» به «ک».
- تبدیل اعداد فارسی و عربی به یک شکل واحد؛ مثلاً «۱۲۸» و «١٢٨» باید با همان شناسه یا مدل لاتین سازگار باشند.
- یکسانسازی فاصلههای سفید و مدیریت نیمفاصله. برای عبارتهای دارای نیمفاصله، شکل چسبیده و شکل فاصلهدار را هم در نظر بگیرید.
- تعریف قاعدهٔ روشن برای خط تیره، دونقطه و نشانهگذاری تا عبارتهای ترکیبی به شکل قابل پیشبینی توکن شوند.
- مدیریت جمع و پسوندهای رایج فقط زمانی که با دادهٔ شما سازگار است؛ stemming تهاجمی میتواند واژههای متفاوت را اشتباه یکی کند.
در Searchic این رفتار برای متن فارسی در لایهٔ نرمالسازی و ساخت variantهای قابل جستجو وجود دارد. با این حال کیفیت نهایی همچنان به دادهٔ ورودی وابسته است: نام، برند، دسته، نام جایگزین و ویژگیهای قابل فیلتر را کامل وارد کنید.
تکمیل خودکار و تحمل غلط تایپی، جای دادهٔ خوب را نمیگیرند
تکمیل خودکار برای کوتاهکردن مسیر کاربر است: از دو یا سه حرف اول، پیشنهادهای واقعی و محبوب را نشان دهید. غلط تایپی نیز باید با حد تحمل محدود فعال شود؛ اگر بیش از حد باز باشد، نتیجههای نامرتبط را بالاتر میآورد. برای نامهای کوتاه، کد محصول و برندهای مشابه، کنترل دقیقتری لازم است.
پس از اینکه موتور گزینههای کاندید را پیدا کرد، ترتیب آنها مهم میشود. در بیشتر کاتالوگها، تطابق دقیق نام باید از تطابق بخشی مهمتر باشد. سپس میتوان وزن عنوان، موجودی، محبوبیت، قیمت یا اولویتهای کسبوکار را به شکل شفاف اضافه کرد. هر قانون رتبهبندی باید با نمونه کوئری واقعی بررسی شود؛ یک قانون خوب برای «گوشی» ممکن است برای «کابل» بد باشد.
کیفیت جستجو را از روی رفتار کاربر بسنجید
بهترین فهرست کلیدواژه از حدس تیم ساخته نمیشود. هر هفته عبارتهای پرتکرار، جستجوهای بدون نتیجه، نتیجههای بدون کلیک و عبارتهایی که کاربر بلافاصله اصلاح میکند را بررسی کنید. اینها منبع اضافهکردن مترادف، نام جایگزین، بهبود داده یا اصلاح رتبهبندی هستند.
برای تغییرهای بزرگ، یک معیار پایه داشته باشید: نرخ صفر نتیجه، نرخ کلیک روی نتیجه، زمان رسیدن به نتیجه و نرخ تبدیل پس از جستجو. سپس تغییر را با گروه کنترل یا آزمایش A/B بسنجید. افزایش تعداد نتیجهها بهتنهایی نشانهٔ بهترشدن نیست؛ مهم این است که کاربر سریعتر نتیجهٔ مناسب را انتخاب کند.
چکلیست انتشار جستجوی فارسی
- دهها کوئری واقعی شامل «ی/ک» عربی، اعداد، نیمفاصله، شکل جمع و غلط تایپی آماده کنید.
- برای هر کوئری، نتیجهٔ اولِ مورد انتظار و نتیجههایی که نباید نمایش داده شوند بنویسید.
- ورودی ایندکس را با شناسهٔ پایدار، عنوان، دسته، نام برند و فیلدهای فیلترپذیر بررسی کنید.
- روی موبایل، تکمیل خودکار و نتیجههای بدون کلیک را هم آزمایش کنید؛ تجربهٔ جستجو فقط endpoint نیست.
- بعد از انتشار، گزارش جستجوهای بدون نتیجه و نرخ کلیک را به برنامهٔ هفتگی محصول اضافه کنید.