Google ಮಂಗಳವಾರ Gemini 3.5 Transcribe ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ. ಈ speech-to-text ಮಾಡೆಲ್ ಅನಗತ್ಯ ಪದಗಳನ್ನು (filler words) ತೆಗೆದುಹಾಕುತ್ತದೆ, ಬಳಕೆದಾರರು ನೀಡಿದ ಶಬ್ದಕೋಶಗಳನ್ನು ಗೌರವಿಸುತ್ತದೆ ಮತ್ತು ಒಂದೇ ರೆಕಾರ್ಡಿಂಗ್ನಲ್ಲಿ ಮೂವರು ವರೆಗೆ ಮಾತನಾಡುವವರನ್ನು ಗುರುತಿಸುತ್ತದೆ (tags). ಯಾವುದೇ ಮಾನವ ಸಂಪನ್ಮೂಲದ ಅಗತ್ಯವಿಲ್ಲದೆ ಕಚ್ಚಾ ಆಡಿಯೋವನ್ನು ಸುಸಜ್ಜಿತವಾದ, ರಚನಾತ್ಮಕ ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸುವ ಮೂಲಕ, ಈ ಸೇವೆಯು ಮೀಟಿಂಗ್ ನೋಟ್ಸ್, ಕಾನೂನು ದಾಖಲೆಗಳು ಮತ್ತು ಹೆಚ್ಚಿನವುಗಳಿಗಾಗಿ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ಗಳನ್ನು ಸರಿಪಡಿಸಲು ಡೆವಲಪರ್ಗಳು ವ್ಯಯಿಸುವ ಸಮಯವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
ಗೂಗಲ್ ಈಗಲೇ ಇದನ್ನು ಏಕೆ ಬಿಡುಗಡೆ ಮಾಡಿದೆ
Google ನ ಆಡಿಯೋ-ಪ್ರೊಸೆಸಿಂಗ್ ಸ್ಟ್ಯಾಕ್ ವರ್ಷಗಳಿಂದ ವಿಕಸನಗೊಳ್ಳುತ್ತಿದೆ, ಆದರೆ ಅದರ ಹಿಂದಿನ Chirp 3 ಮಾಡೆಲ್ ವಿರಾಮಗಳು (pauses), ತಾಂತ್ರಿಕ ಪದಗಳು ಮತ್ತು ಮಾತನಾಡುವವರ ಬದಲಾವಣೆಯ ಸಂದರ್ಭದಲ್ಲಿ ತೊಂದರೆ ಅನುಭವಿಸುತ್ತಿತ್ತು. ರಿಮೋಟ್ ವರ್ಕ್ ಮತ್ತು ಪಾಡ್ಕಾಸ್ಟಿಂಗ್ನ ಬೆಳವಣಿಗೆಯಿಂದಾಗಿ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ ಮಾರುಕಟ್ಟೆಯು ವಿಸ್ತರಿಸಿದೆ, ಆದರೂ ಅನೇಕ ಉದ್ಯಮಗಳು ಇಂದಿಗೂ ಮ್ಯಾನುಯಲ್ ಪ್ರೊಸೆಸಿಂಗ್ ಅಥವಾ ದುಬಾರಿ ವೆಂಡರ್ಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿವೆ. Gemini 3.5 Transcribe ಆ ಸಮಸ್ಯೆಗೆ ಪರಿಹಾರ ನೀಡುತ್ತದೆ: ಇದು ಕೇವಲ ಮಾತನ್ನು ಗುರುತಿಸುವುದು ಮಾತ್ರವಲ್ಲದೆ, ಅದನ್ನು ತಕ್ಷಣವೇ (on the fly) ಎಡಿಟ್ ಮಾಡುತ್ತದೆ.
ಈ ಹೊಸ ಮಾಡೆಲ್ ವಾಸ್ತವವಾಗಿ ಏನು ಮಾಡುತ್ತದೆ
- ಸ್ವಯಂಚಾಲಿತ ಫಿಲ್ಲರ್-ವರ್ಡ್ ತೆಗೆದುಹಾಕುವಿಕೆ – ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ ಸಿದ್ಧವಾಗುತ್ತಿದ್ದಂತೆ “um”, “uh” ಮತ್ತು ಅಂತಹ ಅನಗತ್ಯ ಪದಗಳು ಮಾಯವಾಗುತ್ತವೆ, ಇದರಿಂದ ಓದಲು ಸುಲಭವಾದ ಪಠ್ಯ ಸಿಗುತ್ತದೆ.
- ಕಸ್ಟಮ್ ಶಬ್ದಕೋಶಗಳು (Custom vocabularies) – ಬಳಕೆದಾರರು ನಿರ್ದಿಷ್ಟ ಕ್ಷೇತ್ರಕ್ಕೆ ಸಂಬಂಧಿಸಿದ ಪದಗಳ ಪಟ್ಟಿಯನ್ನು ಅಪ್ಲೋಡ್ ಮಾಡಬಹುದು, ಇದರಿಂದ ಮಾಡೆಲ್ ಆ ಪದಗಳನ್ನು ಸಾಮಾನ್ಯ ಪದಗಳಾಗಿ "ತಿದ್ದುವ" ತಪ್ಪನ್ನು ಮಾಡುವುದಿಲ್ಲ. ಸಂಕ್ಷಿಪ್ತ ರೂಪಗಳು (acronyms), ಉತ್ಪನ್ನದ ಹೆಸರುಗಳು ಅಥವಾ ವಿದೇಶಿ ಕಾಗುಣಿತಗಳಿರುವ ಕ್ಷೇತ್ರಗಳಿಗೆ ಇದು ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ.
- ಮಾತನಾಡುವವರ ಗುರುತಿಸುವಿಕೆ (Speaker attribution) – ಈ ಸಿಸ್ಟಮ್ ಮೂವರು ವರೆಗೆ ವಿಭಿನ್ನ ಧ್ವನಿಗಳನ್ನು ಗುರುತಿಸುತ್ತದೆ, ಪ್ರತಿಯೊಂದು ಮಾತಿಗೆ ಸ್ಪೀಕರ್ ಲೇಬಲ್ ನೀಡುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಪದಕ್ಕೆ ಸಮಯದ ಮುದ್ರೆ (timestamp) ಸೇರಿಸುತ್ತದೆ. ಕಾನೂನು ತಂಡಗಳು, ವೈದ್ಯಕೀಯ ಲೇಖಕರು ಮತ್ತು ಪತ್ರಕರ್ತರು ಮೂಲ ಫೈಲ್ನಿಂದಲೇ ಸಮಯದ ಮುದ್ರೆ ಹೊಂದಿರುವ ದಾಖಲೆಗಳನ್ನು ತಯಾರಿಸಬಹುದು.
- ಬಹುಭಾಷಾ ವ್ಯಾಪ್ತಿ – Google ತನ್ನ ಹಿಂದಿನ ಮಾಡೆಲ್ಗಿಂತ ಹೆಚ್ಚಿನ ನಿಖರತೆಯನ್ನು 85 ಕ್ಕೂ ಹೆಚ್ಚು ಭಾಷೆಗಳಲ್ಲಿ ನೀಡುತ್ತದೆ ಎಂದು ಹೇಳಿಕೊಂಡಿದೆ.
ಈ ಎಲ್ಲಾ ಸಾಮರ್ಥ್ಯಗಳು ಡೆವಲಪರ್-ಫೋಕಸ್ಡ್ API ಮೂಲಕ ಲಭ್ಯವಿವೆ. ಅಪ್ಲಿಕೇಶನ್ಗಳು ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ಗಾಗಿ ವಿನಂತಿಸಿದಾಗ, ಸ್ವಚ್ಛಗೊಳಿಸಿದ ಪಠ್ಯ, ಸ್ಪೀಕರ್ ಟ್ಯಾಗ್ಗಳು ಮತ್ತು ಟೈಮ್ಸ್ಟ್ಯಾಂಪ್ಗಳನ್ನು ಒಳಗೊಂಡಿರುವ JSON ಪೇಲೋಡ್ ಅನ್ನು ಪಡೆಯುತ್ತವೆ.
Gemini ಆಡಿಯೋ ವಿತರಣೆಯ ವಿಸ್ತೃತ ನೋಟ
Gemini 3.5 Transcribe ಎಂಬುದು ಆಡಿಯೋ ಮಾಡೆಲ್ಗಳ ವಿಸ್ತೃತ ಕುಟುಂಬಕ್ಕೆ ಸೇರಿದೆ:
- Gemini 3.5 Live – ಇದು ರಿಯಲ್-ಟೈಮ್ ಸಂವಹನಕ್ಕಾಗಿ ರೂಪಿಸಲಾಗಿದೆ, ಇದು ಹಿಂದಿನ ಲೈವ್ ಮಾಡೆಲ್ಗಳಿಗಿಂತ ವಾಕ್ಯದ ಮಧ್ಯದಲ್ಲಿ ಬರುವ ಅಡೆತಡೆಗಳನ್ನು ಉತ್ತಮವಾಗಿ ನಿಭಾಯಿಸುತ್ತದೆ.
- Gemini 3.5 Live Experimental – ಇದು ಸಂಕೀರ್ಣ ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸುವಾಗ ತನ್ನದೇ ಆದ ಹಂತ-ಹಂತದ ಆಲೋಚನೆಯನ್ನು ವಿವರಿಸುವ ಉನ್ನತ ಮಟ್ಟದ ರೀಸನಿಂಗ್ ವೇರಿಯಂಟ್ ಆಗಿದೆ.
ಈ ಎರಡೂ ಲೈವ್ ಮಾಡೆಲ್ಗಳು ಪ್ರಸ್ತುತ macOS Gemini ಅಪ್ಲಿಕೇಶನ್ನಲ್ಲಿ ಮತ್ತು ಕೆಲವು ಪ್ರದೇಶಗಳಲ್ಲಿ ಆಂಡ್ರಾಯ್ಡ್ನಲ್ಲಿ Rambler ಡಿಕ್ಟೇಶನ್ ಫೀಚರ್ ಮೂಲಕ ಇಂಗ್ಲಿಷ್ನಲ್ಲಿ ಲಭ್ಯವಿವೆ.
ಯಾರು ಪ್ರಯೋಜನ ಪಡೆಯಬಹುದು
ಡೆವಲಪರ್ಗಳು ಸಹಯೋಗ ಸಾಧಿಸುವ ಪರಿಕರಗಳು (collaboration tools), ಕಂಟೆಂಟ್ ಕ್ರಿಯೇಷನ್ ಪ್ಲಾಟ್ಫಾರ್ಮ್ಗಳು ಮತ್ತು ವಾಯ್ಸ್-ಡ್ರಿವನ್ ಅಸಿಸ್ಟೆಂಟ್ಗಳಲ್ಲಿ "ಮಾತನಾಡುವಾಗಲೇ ಸ್ವಚ್ಛಗೊಳಿಸುವ" (clean-as-you-speak) ಪ್ರಕ್ರಿಯೆಯನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳಬಹುದು. ಉದ್ಯಮಗಳು ಪ್ರಕಟಿಸಲು ಸಿದ್ಧವಾಗಿರುವ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ಗಳನ್ನು ತಯಾರಿಸಬಹುದು, ಇದರಿಂದ ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ ಶುಲ್ಕ ವಿಧಿಸುವ ಮತ್ತು ಕಟ್ಟುನಿಟ್ಟಿನ ಡೇಟಾ-ಹ್ಯಾಂಡ್ಲಿಂಗ್ ನಿಯಮಗಳನ್ನು ಹೊಂದಿರುವ ಥರ್ಡ್-ಪಾರ್ಟಿ ಸೇವೆಗಳ ಮೇಲಿನ ಅವಲಂಬನೆ ಕಡಿಮೆಯಾಗುತ್ತದೆ. ಕಂಟೆಂಟ್ ಕ್ರಿಯೇಟರ್ಗಳು ಪ್ರತ್ಯೇಕ ಎಡಿಟಿಂಗ್ ಇಲ್ಲದೆಯೇ ಸುಸಜ್ಜಿತವಾದ ಕ್ಯಾಪ್ಶನ್ಗಳನ್ನು ಪ್ರಕಟಿಸಬಹುದು, ಇದು ವಿಡಿಯೋ ಮತ್ತು ಪಾಡ್ಕಾಸ್ಟ್ ತಯಾರಿಕೆಯ ವೇಗವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ.
ಯಾರಿಗೆ ಹೊಡೆತ ಬೀಳಬಹುದು
ಸ್ಪೀಕರ್ ಡಯರೈಸೇಶನ್ (speaker diarization) ಮತ್ತು ತಾಂತ್ರಿಕ ಪದಗಳ ನಿರ್ವಹಣೆಗಾಗಿ ಹೆಚ್ಚಿನ ದರ ವಿಧಿಸುವ ವಿಶೇಷ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ ವೆಂಡರ್ಗಳ ಬೇಡಿಕೆ ಕಡಿಮೆಯಾಗಬಹುದು, ವಿಶೇಷವಾಗಿ ವೆಚ್ಚದ ಬಗ್ಗೆ ಜಾಗರೂಕರಾಗಿರುವ ಸ್ಟಾರ್ಟ್ಅಪ್ಗಳಲ್ಲಿ ಇದು ಕಂಡುಬರಬಹುದು. ಈ ಮಾಡೆಲ್ನ ಮೂವರು ಮಾತನಾಡುವವರ ಮಿತಿಯು, ದೊಡ್ಡ ಸಂಸ್ಥೆಗಳನ್ನು ಒಂದೇ ಕರೆಯಲ್ಲಿ ಹೆಚ್ಚಿನ ಜನರನ್ನು ಬೆಂಬಲಿಸುವ ಪ್ರತ್ಯೇಕ ಪರಿಹಾರಗಳತ್ತ ತಳ್ಳಬಹುದು.
ಮಿತಿಗಳು ಮತ್ತು ತೆರೆದ ಪ್ರಶ್ನೆಗಳು
- ಮಾತನಾಡುವವರ ಸಂಖ್ಯೆ – ಪ್ರತಿ ಫೈಲ್ನಲ್ಲಿ ಕೇವಲ ಮೂವರು ಮಾತನಾಡುವವರನ್ನು ಮಾತ್ರ ಗುರುತಿಸಬಹುದು; ಹೆಚ್ಚಿನ ಸದಸ್ಯರಿರುವ ಮೀಟಿಂಗ್ಗಳಿಗೆ ಇಂದಿಗೂ ಬಾಹ್ಯ ಪರಿಕರಗಳ ಅಗತ್ಯವಿರುತ್ತದೆ.
- ಭಾಷಾ ವಿತರಣೆ – ಬಹುಭಾಷಾ ಬೆಂಬಲವನ್ನು ಘೋಷಿಸಲಾಗಿದೆ, ಆದರೆ ಲೈವ್ ಮಾಡೆಲ್ಗಳು ಇಂಗ್ಲಿಷ್ನಲ್ಲಿ ಮಾತ್ರ ಲಭ್ಯವಿವೆ, ಇದರಿಂದ ಇಂಗ್ಲಿಷ್ ಅಲ್ಲದ ಬಳಕೆದಾರರು ಪೂರ್ಣ ಕಾರ್ಯಕ್ಷಮತೆಗಾಗಿ ಕಾಯಬೇಕಾಗಿದೆ.
- ಗೌಪ್ಯತೆ – ಯಾವುದೇ ಕ್ಲೌಡ್-ಆಧಾರಿತ ಸ್ಪೀಚ್ ಸೇವೆಯಂತೆ, ಉದ್ಯಮಗಳು Google ನ ಮೂಲಸೌಕರ್ಯದ ಅನುಕೂಲತೆಯನ್ನು ಮತ್ತು ಸೂಕ್ಷ್ಮ ಆಡಿಯೋವನ್ನು ಬಾಹ್ಯ ಸರ್ವರ್ಗಳಿಂದ ದೂರವಿಡುವ ಅಗತ್ಯತೆಯನ್ನು ಪರಿಗಣಿಸಬೇಕಾಗುತ್ತದೆ. Google ನ ನಿಯಮಗಳು ಕೆಲವು ಗ್ರಾಹಕರಿಗೆ ಆನ್-ಪ್ರೆಮಿಸ್ ಡಿಪ್ಲಾಯ್ಮೆಂಟ್ ಅನ್ನು ಅನುಮತಿಸುತ್ತವೆ, ಆದರೆ ಆ ಆಯ್ಕೆಯು ಇನ್ನೂ ಸಾರ್ವಜನಿಕವಾಗಿ ಲಭ್ಯವಿಲ್ಲ.
ಮುಂದೆ ಏನಾಗಬಹುದು
ಮಾತನಾಡುವವರ ಮಿತಿಯನ್ನು ಹೆಚ್ಚಿಸುವ ಮತ್ತು ಲೈವ್ ಮಾಡೆಲ್ ವ್ಯಾಪ್ತಿಯನ್ನು ಹೆಚ್ಚಿನ ಭಾಷೆಗಳಿಗೆ ವಿಸ್ತರಿಸುವ ಭವಿಷ್ಯದ ಅಪ್ಡೇಟ್ಗಳ ಬಗ್ಗೆ Google ಸುಳಿವು ನೀಡಿದೆ. API ನ ಬೆಲೆ ವಿಧಗಳನ್ನು ಗಮನಿಸುವುದು ಕೂಡ ಅತ್ಯಗತ್ಯ; ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ ಹೆಚ್ಚಿನ ವೆಚ್ಚವು ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದಲ್ಲಿ ಬಳಸುವ ಬಳಕೆದಾರರ ಉತ್ಪಾದಕತೆಯನ್ನು ಕುಗ್ಗಿಸಬಹುದು. ಅಂತಿಮವಾಗಿ, ಸ್ವಯಂಚಾಲಿತ ಫಿಲ್ಲರ್ ರಿಮೂವಲ್ನ ಅನುಕೂಲತೆಯು ನಿರ್ದಿಷ್ಟ ಶಬ್ದಕೋಶಗಳಲ್ಲಿನ ಉಳಿದ ತಪ್ಪುಗಳಿಗಿಂತ ಹೆಚ್ಚಾಗಿದೆಯೇ ಎಂಬುದನ್ನು ಡೆವಲಪರ್ಗಳ ನಡುವಿನ ಅಳವಡಿಕೆಯು ತಿಳಿಸುತ್ತದೆ.
ಮುಖ್ಯ ಅಂಶ: Gemini 3.5 Transcribe ಮಾತನಾಡುವ ರೆಕಾರ್ಡಿಂಗ್ಗಳನ್ನು ಪರಿಷ್ಕರಿಸುವ ಕಷ್ಟಕರವಾದ ಕೆಲಸವನ್ನು ಕೇವಲ ಒಂದು API ಕರೆಯ ಮೂಲಕ ಸುಲಭಗೊಳಿಸುತ್ತದೆ, ಇದು ಡೆವಲಪರ್ಗಳಿಗೆ ಸ್ವಚ್ಛವಾದ ಮತ್ತು ಸ್ಪೀಕರ್-ಟ್ಯಾಗ್ ಮಾಡಲಾದ ಪಠ್ಯಕ್ಕಾಗಿ ಸಿದ್ಧ ಪರಿಕರವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಇದರ ಯಶಸ್ಸು Google ಎಷ್ಟು ವೇಗವಾಗಿ ಭಾಷಾ ಬೆಂಬಲವನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ, ಸ್ಪೀಕರ್ ಮಿತಿಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ ಮತ್ತು ಎಂಟರ್ಪ್ರೈಸ್ ಗೌಪ್ಯತೆಯ ಕಾಳಜಿಗಳನ್ನು ಪರಿಹರಿಸುತ್ತದೆ ಎಂಬುದರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ.
