ഗൂഗിളിൻ്റെ ഇമേജൻ 3: ഇമേജ് ജനറേഷനിലെ ഏറ്റവും പുതിയ AI വിപ്ലവമാണോ ഇത്?

ഗൂഗിൾ ഇമേജൻ ഐ

ഇമേജുകൾ സൃഷ്ടിക്കുന്നതിനായി ഗൂഗിൾ അതിൻ്റെ പുതിയ AI മോഡൽ പുറത്തിറക്കി, അതിനെ ഇമേജൻ 3 എന്ന് വിളിക്കുന്നു . ഈ റിലീസിനെക്കുറിച്ച് കമ്പനി വലിയ പ്രഖ്യാപനം നടത്തിയിട്ടില്ല. പകരം, വലിയ ആർഭാടങ്ങളില്ലാതെ മോഡൽ ഉപയോക്താക്കൾക്ക് ലഭ്യമാക്കി. റിലീസിനൊപ്പം, മോഡൽ എങ്ങനെ പ്രവർത്തിക്കുന്നുവെന്ന് വിശദീകരിക്കുന്ന ഒരു ഗവേഷണ പ്രബന്ധവും ഗൂഗിൾ ഓൺലൈനിൽ പ്രസിദ്ധീകരിച്ചു.

ലഭ്യതയും സവിശേഷതകളും

ഇപ്പോൾ, ഇമേജൻ 3 യുഎസിലെ ഉപയോക്താക്കൾക്ക് മാത്രമേ ലഭ്യമാകൂ. മറ്റ് രാജ്യങ്ങളിൽ ഇത് എപ്പോൾ ലഭ്യമാകും എന്നതിനെ കുറിച്ച് ഇതുവരെ ഒരു വിവരവുമില്ല. ഗൂഗിളിൻ്റെ AI ടെസ്റ്റ് കിച്ചൻ വഴി ഉപയോക്താക്കൾക്ക് മോഡൽ ആക്സസ് ചെയ്യാൻ കഴിയും . ഈ പ്ലാറ്റ്‌ഫോം ആളുകളെ സൈൻ അപ്പ് ചെയ്യാനും ഇമേജുകൾ സൃഷ്‌ടിക്കാൻ ഇമേജൻ 3 ഉപയോഗിച്ച് തുടങ്ങാനും അനുവദിക്കുന്നു.

ഗൂഗിളിൻ്റെ ഇമേജൻ മോഡലിൻ്റെ മൂന്നാമത്തെ പതിപ്പാണ് ഇമേജൻ 3. മെച്ചപ്പെടുത്തിയ ടെക്സ്ചർ ജനറേഷൻ, മികച്ച വാക്ക് തിരിച്ചറിയൽ, നിർദ്ദേശങ്ങൾ കർശനമായി പാലിക്കൽ എന്നിവ ഇതിൽ ഫീച്ചർ ചെയ്യുന്നു. നൽകിയിരിക്കുന്ന വിവരണങ്ങളെ അടിസ്ഥാനമാക്കി ചിത്രങ്ങൾ സൃഷ്ടിക്കുന്നത് മികച്ചതായിരിക്കണം എന്നാണ് ഇതിനർത്ഥം.

ഉപയോക്തൃ അനുഭവവും പ്രശ്നങ്ങളും

നിലവിൽ, ഇമേജൻ 3-നെ കുറിച്ച് ചില സമ്മിശ്ര അവലോകനങ്ങൾ ഉണ്ട്. എന്നിരുന്നാലും, ഒന്നിലധികം ആളുകൾ ഉൾപ്പെടുന്ന ക്ലോസ്-അപ്പ് ചിത്രങ്ങളും മോശം പ്രകാശമുള്ള രംഗങ്ങളും ചില ഉപയോക്താക്കൾക്ക് പ്രശ്‌നമുള്ളതായി തോന്നുന്നു. മോഡലിൻ്റെ മുൻ പതിപ്പ് മികച്ച പ്രകടനം കാഴ്ചവച്ച മേഖലകളായിരുന്നു ഇവ.

റിപ്പോർട്ട് ചെയ്യപ്പെട്ട മറ്റൊരു പ്രശ്നം കൈകാലുകളുടെ ചിത്രങ്ങൾ സൃഷ്ടിക്കുന്നതാണ്.

ഉപയോക്താക്കൾ "ഒരു കപ്പ് കാപ്പി കൈവശം വച്ചിരിക്കുന്ന ഒരാൾ" പോലുള്ള നിർദ്ദേശങ്ങൾ ഉപയോഗിക്കുമ്പോൾ, മോഡൽ ചിലപ്പോൾ അസാധാരണമായ രീതിയിൽ വസ്തുക്കളുമായി അധിക അവയവങ്ങൾ ഉണ്ടാക്കുകയോ അവയവങ്ങൾ ലയിപ്പിക്കുകയോ ചെയ്തുവെന്ന് കണ്ടെത്തി. പ്രോംപ്റ്റുകൾക്കായി മോഡലിന് വളരെ കർശനമായ സെൻസർഷിപ്പ് നിയമങ്ങളുണ്ട്, അത് ഫലങ്ങളെ ബാധിച്ചേക്കാം.

സാങ്കേതിക വിശദാംശങ്ങൾ

arXiv-ൽ പ്രസിദ്ധീകരിച്ച ഗൂഗിളിൻ്റെ ഗവേഷണ പ്രബന്ധം Imagen 3-ൻ്റെ ചില സാങ്കേതിക വശങ്ങൾ വിശദീകരിക്കുന്നു . ലാറ്റൻ്റ് ഡിഫ്യൂഷൻ എന്ന സാങ്കേതികതയാണ് മോഡൽ ഉപയോഗിക്കുന്നത്. സ്റ്റേബിൾ ഡിഫ്യൂഷൻ വഴി ജനപ്രിയമാക്കിയ ഡിഫ്യൂഷൻ മോഡലിൻ്റെ ഒരു വ്യതിയാനമാണ് ഈ രീതി. മോഡൽ ഉപയോഗിക്കുന്നതിൽ നിന്ന് സാധ്യമായ ദോഷങ്ങൾ കുറയ്ക്കുന്നതിന് പുതിയ രീതികൾ നടപ്പിലാക്കിയിട്ടുണ്ടെന്നും ഗൂഗിൾ സൂചിപ്പിച്ചു.

മറ്റ് മോഡലുകളുമായുള്ള താരതമ്യം

ജെമിനിയുടെ ഫ്രീ-ടയർ ചാറ്റ്ബോട്ടിൽ നിന്ന് വ്യത്യസ്തമായി, ഇമേജുകൾ സൃഷ്ടിക്കാനും വ്യത്യസ്ത കഴിവുകൾ ഉപയോഗിക്കാനും കഴിയും, ഇമേജൻ 3 ഒരു പ്രത്യേക വാസ്തുവിദ്യയിലാണ് നിർമ്മിച്ചിരിക്കുന്നത്. ഇമേജൻ 3 പ്രധാനമായും ഇമേജ് ഡാറ്റയിൽ പരിശീലിപ്പിച്ചിരിക്കുന്നു, ഇത് മികച്ചതും കൂടുതൽ കൃത്യവുമായ AI ഇമേജുകൾ സൃഷ്ടിക്കാൻ സഹായിക്കുന്നു.

ഇമേജിനെക്കുറിച്ചുള്ള പോയിൻ്റുകളുടെ സംഗ്രഹം 3

  1. ഇമേജ് ജനറേഷനായി ഗൂഗിൾ അതിൻ്റെ ഇമേജൻ 3 എഐ മോഡൽ വ്യാഴാഴ്ച പുറത്തിറക്കി.
  2. ഈ മോഡൽ നിലവിൽ യുഎസിലെ ഉപയോക്താക്കൾക്ക് മാത്രമേ ലഭ്യമാകൂ.
  3. ഗൂഗിളിൻ്റെ AI ടെസ്റ്റ് കിച്ചൻ വഴി ഉപയോക്താക്കൾക്ക് ഇമേജൻ 3 ആക്സസ് ചെയ്യാൻ കഴിയും.
  4. ഇമേജൻ 3 ടെക്സ്ചർ മെച്ചപ്പെടുത്തി, മികച്ച വാക്ക് തിരിച്ചറിയൽ, കർശനമായ പ്രോംപ്റ്റ് പാലിക്കൽ എന്നിവയുണ്ട്.
  5. ചില ഉപയോക്താക്കൾ ക്ലോസ്-അപ്പ് ചിത്രങ്ങളും അണ്ടർലൈറ്റ് സീനുകളും സംബന്ധിച്ച പ്രശ്നങ്ങൾ റിപ്പോർട്ട് ചെയ്യുന്നു.
  6. ചിത്രങ്ങളിൽ കൃത്യമായ അവയവങ്ങൾ സൃഷ്ടിക്കുന്നതിൽ മോഡൽ പോരാടുന്നു.
  7. ഗൂഗിളിൻ്റെ ഗവേഷണ പ്രബന്ധം ഡിഫ്യൂഷൻ മോഡലുകളുടെ ഒരു വകഭേദമായ ലാറ്റൻ്റ് ഡിഫ്യൂഷൻ്റെ ഉപയോഗത്തെ കുറിച്ച് വിശദമാക്കുന്നു.
  8. ഇമേജൻ 3 ജെമിനിയുടെ ഇമേജ് ജനറേഷനിൽ നിന്ന് വ്യത്യസ്തമാണ്, ഇമേജ്-നിർദ്ദിഷ്ട പരിശീലനത്തിൽ കൂടുതൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു.