بهبود نرم افزار صوتی کروم

کسب‌وکارهای نوپا:کروم در درک وقفه‌ها و علائم نگارشی که هرگز با صدای بلند نمی‌گویید، بهتر می‌شود.گوگل بی‌سروصدا در حال طبیعی‌تر کردن دیکته صوتی در کروم است. با جدیدترین نسخه بتای کروم ۱۵۱، این شرکت قابلیت جدیدی را معرفی می‌کند که به موتور تشخیص گفتار مرورگر اجازه می‌دهد تا به‌طور خودکار بر اساس نحوه صحبت افراد، علائم نگارشی را استنباط کند و نیاز به گفتن صریح دستوراتی مانند «ویرگول» یا «نقطه» را از بین ببرد.

این به‌روزرسانی ممکن است در نگاه اول جزئی به نظر برسد، اما یکی از بزرگترین مشکلات تایپ صوتی را برطرف می‌کند: صحبت کردن به‌طور طبیعی اغلب متنی تولید می‌کند که فاقد علائم نگارشی است، مگر اینکه کاربران آگاهانه هر علامت نگارشی را دیکته کنند. گوگل با آموزش کروم برای درک مکث‌ها، ریتم و الگوهای گفتاری، گامی دیگر در جهت انسانی‌تر کردن مکالمات با رایانه‌ها برمی‌دارد.

کروم می‌خواهد بفهمد که شما چگونه صحبت می‌کنید، نه فقط آنچه می‌گویید
این ویژگی جدید از طریق API گفتار وب در کروم ۱۵۱ بتا ارائه می‌شود. گوگل یک ویژگی بولی unspokenPunctuation جدید به رابط SpeechRecognition اضافه کرده است. وقتی این قابلیت فعال باشد، موتور تشخیص گفتار به طور خودکار بر اساس مکث‌ها، آهنگ کلام و آهنگ کلام، علائم نگارشی را وارد می‌کند، به جای اینکه از کاربران بخواهد دستورات نگارشی را با صدای بلند بیان کنند.

از نظر عملی، این بدان معناست که کاربران می‌توانند یک ایمیل، سند یا پیام را به سبک مکالمه‌ای طبیعی‌تر دیکته کنند، در حالی که کروم محل قرارگیری ویرگول، نقطه و سایر علائم نگارشی را تعیین می‌کند.

این بهبود به ویژه برای جلسات دیکته طولانی‌تر مفید است که در آن تکرار مکرر «ویرگول»، «نقطه» یا «علامت سوال» جریان طبیعی گفتار را مختل می‌کند. همچنین می‌تواند ابزارهای رونویسی مبتنی بر مرورگر، برنامه‌های یادداشت‌برداری، نرم‌افزارهای دسترسی و دستیارهای نوشتاری مبتنی بر هوش مصنوعی را به طور قابل توجهی روان‌تر کند.

توسعه‌دهندگان نیز از این مزیت بهره‌مند خواهند شد.

از آنجایی که این ویژگی بخشی از API گفتار وب کروم است، برنامه‌های وب که به تشخیص گفتار متکی هستند می‌توانند این قابلیت را بدون نیاز به ساخت مدل‌های نگارشی خود پیاده‌سازی کنند.

گوگل می‌گوید این ویژگی به جای تکیه صرف بر کلمات گفتاری، با تجزیه و تحلیل مکث‌های گفتار و آهنگ کلام کار می‌کند و تشخیص گفتار مبتنی بر مرورگر را به نحوه ارتباط طبیعی انسان نزدیک‌تر می‌کند.

این افزوده شدن همچنین نشان‌دهنده‌ی روند گسترده‌تری در اکوسیستم نرم‌افزاری گوگل است. با ادغام فزاینده‌ی Gemini و مدل‌های زبانی مبتنی بر هوش مصنوعی در محصولاتی مانند کروم، اندروید و Workspace، این شرکت تأکید بیشتری بر درک مکالمه‌ی طبیعی انسان دارد، به جای اینکه از کاربران بخواهد گفتار خود را برای ماشین‌ها تطبیق دهند.

نسخه بتای کروم ۱۵۱ در حال حاضر این ویژگی را برای آزمایش توسط توسعه‌دهندگان در اختیار دارد، اگرچه دسترسی گسترده‌تر به برنامه‌ی انتشار پایدار مرورگر بستگی دارد. همانند بسیاری از APIهای آزمایشی، توسعه‌دهندگان در نهایت تعیین خواهند کرد که این ویژگی چقدر در برنامه‌های وب به کار گرفته می‌شود.

در حالی که نقطه‌گذاری خودکار، تایپ صوتی را یک شبه متحول نمی‌کند، اما نوعی بهبود کیفیت زندگی است که کاربران احتمالاً هر بار که پیامی را دیکته می‌کنند یا مکالمه‌ای را رونویسی می‌کنند، متوجه آن می‌شوند. گاهی اوقات بزرگترین ارتقاها، ویژگی‌های جدید و پر زرق و برق هوش مصنوعی نیستند، بلکه تغییرات کوچکی هستند که فناوری را در درک نحوه‌ی ارتباط فعلی افراد بهتر می‌کنند.

گروه اخبار

  • هنوز نظری ندارید.
  • افزودن دیدگاه