Хиймэл оюун ухаан хэр нарийвчлалтай вэ?

Хиймэл оюун ухаан хэр нарийвчлалтай вэ? [Видео болон асуулт хариулт]

Товчхон хариулт: Хиймэл оюун ухаан нь нарийн, сайн тодорхойлсон даалгаврууд дээр тодорхой үндэслэлтэй, өндөр нарийвчлалтай байж болох ч "нарийвчлал" гэдэг нь таны бүх нийтээр итгэж болох цорын ганц оноо биш юм. Энэ нь зөвхөн даалгавар, өгөгдөл, хэмжүүр нь үйл ажиллагааны орчинтой нийцэж байх үед л хүчинтэй; оролтууд зөрүүтэй эсвэл даалгаварууд нээлттэй болох үед алдаа, өөртөө итгэлтэй хий үзэгдэл нэмэгддэг.

Гол дүгнэлтүүд:

Даалгаварт тохирох байдал: "Зөв" ба "буруу"-г шалгах боломжтой байхаар ажлыг нарийн тодорхойл.

Метрийн сонголт: Үнэлгээний хэмжүүрийг уламжлал эсвэл тохиромжтой байдалд бус, харин бодит үр дагаварт тохируул.

Бодит байдлын тест: Төлөөллийн, шуугиантай өгөгдөл болон түгээлтийн бус стресс тестийг ашиглана уу.

Тохируулга: Ялангуяа босго утгуудын хувьд итгэл үнэмшил зөвтэй нийцэж байгаа эсэхийг хэмжинэ.

Амьдралын мөчлөгийн хяналт: Хэрэглэгчид, өгөгдөл болон орчин цаг хугацааны явцад өөрчлөгдөхийн хэрээр тасралтгүй дахин үнэлэх.

Үүний дараа таны унших дуртай нийтлэлүүд:

🔗 Хиймэл оюун ухааныг алхам алхмаар хэрхэн сурах вэ
Хиймэл оюун ухааныг өөртөө итгэлтэйгээр сурч эхлэхэд зориулсан анхан шатны хүмүүст ээлтэй замын зураг.

🔗 Хиймэл оюун ухаан өгөгдөл дэх гажигийг хэрхэн илрүүлдэг вэ
Хиймэл оюун ухаан ер бусын хэв маягийг автоматаар илрүүлэхийн тулд ашигладаг аргуудыг тайлбарладаг.

🔗 Яагаад хиймэл оюун ухаан нийгэмд муугаар нөлөөлж болох вэ
Нэгэнт ялгаварлан гадуурхах байдал, ажлын байрны нөлөөлөл, хувийн нууцын асуудал зэрэг эрсдэлүүдийг хамарна.

🔗 Хиймэл оюун ухааны өгөгдлийн багц гэж юу вэ, яагаад чухал вэ
Өгөгдлийн багц болон тэдгээр нь хиймэл оюун ухааны загваруудыг хэрхэн сургаж, үнэлдэгийг тодорхойлдог.


1) Тэгэхээр... Хиймэл оюун ухаан хэр нарийвчлалтай вэ?🧠✅

Хиймэл оюун ухаан нь нарийн, сайн тодорхойлсон даалгаварт, ялангуяа "зөв хариулт" нь хоёрдмол утгагүй бөгөөд оноо авахад хялбар үед маш нарийвчлалтай байж чаддаг

Гэхдээ нээлттэй даалгаварт (ялангуяа генератив хиймэл оюун ухаанд ) "нарийвчлал" хурдан гулгамтгай болдог, учир нь:

  • хэд хэдэн хүлээн зөвшөөрөгдсөн хариулт байж болно

  • гаралт нь чөлөөтэй байж болох ч баримтад үндэслээгүй байж болно

  • загварыг хатуу зөв байдалд биш, харин "тусламжийн" мэдрэмжид тохируулсан байж магадгүй юм

  • дэлхий ертөнц өөрчлөгдөж, системүүд бодит байдлаас хоцорч магадгүй

Хэрэгтэй сэтгэцийн загвар: нарийвчлал бол таны "байгаа" шинж чанар биш. Энэ бол тодорхой орчинд, тодорхой хэмжилтийн тохиргоотойгоор тодорхой даалгаврын төлөө "олж авдаг" шинж чанар юм. Тийм ч учраас ноцтой удирдамж нь үнэлгээг нэг удаагийн онооны самбарын мөч биш, харин амьдралын мөчлөгийн үйл ажиллагаа гэж үздэг. [1]

 

Хиймэл оюун ухааны нарийвчлал

2) Нарийвчлал бол нэг зүйл биш - энэ бол бүхэл бүтэн алагласан гэр бүл 👨👩👧👦📏

Хүмүүс "нарийвчлал" гэж хэлэхдээ эдгээрийн аль нэгийг нь хэлж байж магадгүй (мөн тэд ихэвчлэн анзааралгүйгээр нэг дор хоёрыг нь хэлж байгаа байх):

  • Зөв байдал: зөв шошго/хариулт өгсөн үү?

  • Нарийвчлал ба эргэн санах: энэ нь хуурамч дохиололоос зайлсхийсэн үү, эсвэл бүх зүйлийг барьж чадсан уу?

  • Тохируулга: "Би 90% итгэлтэй байна" гэж хэлэхэд энэ нь үнэндээ ~90% тохиолдолд зөв үү? [3]

  • Бат бөх чанар: оролт бага зэрэг өөрчлөгдсөн ч (шуугиан, шинэ хэллэг, шинэ эх сурвалж, шинэ демографик) ажиллах уу?

  • Найдвартай байдал: хүлээгдэж буй нөхцөлд тогтвортой ажилладаг уу?

  • Үнэнч байдал / бодит байдал (үйлдвэрлэх хиймэл оюун ухаан): энэ нь өөртөө итгэлтэй өнгө аястайгаар юм зохиож (хий үзэгдэл үзүүлж) байна уу? [2]

Тийм ч учраас итгэлцэлд төвлөрсөн хүрээнүүд нь "нарийвчлал"-ыг ганцаарчилсан баатрын хэмжүүр гэж үздэггүй. Тэд хүчин төгөлдөр байдал, найдвартай байдал, аюулгүй байдал, ил тод байдал, бат бөх байдал, шударга байдал гэх мэт олон зүйлийг цогц байдлаар авч үздэг - учир нь та нэгийг нь "оновчтой" болгож, нөгөөг нь санамсаргүйгээр эвдэж болно. [1]


3) "Хиймэл оюун ухаан хэр нарийвчлалтай вэ?" хэмжилтийн сайн хувилбарыг юу тодорхойлдог вэ? 🧪🔍

"Сайн хувилбар"-ын шалгах жагсаалт энд байна (хүмүүс алгасаад дараа нь харамсдаг):

✅ Даалгаврын тодорхой тодорхойлолт (өөрөөр хэлбэл турших боломжтой болгох)

  • "Товчлон дүгнэх" гэдэг нь тодорхойгүй байна.

  • “5 цэг дээр нэгтгэн дүгнэж, эх сурвалжаас 3 тодорхой тоо оруулж, ишлэл зохиож болохгүй” гэсэн дүрмийг шалгаж болно.

✅ Төлөөллийн тестийн өгөгдөл (өөрөөр хэлбэл хялбар горим дээр үнэлгээг зогсоох)

Хэрэв таны тестийн багц хэтэрхий цэвэрхэн байвал нарийвчлал нь хуурамч харагдах болно. Бодит хэрэглэгчид бичгийн алдаа, хачин ирмэгийн жижиг үсэг, "Би үүнийг утсан дээрээ шөнийн 2 цагт бичсэн" гэсэн энергийг авчирдаг.

✅ Эрсдэлтэй тохирох үзүүлэлт

Мемийг буруу ангилах нь эмнэлгийн сэрэмжлүүлгийг буруу ангилахтай адил биш юм. Та уламжлал дээр үндэслэн хэмжүүрийг сонгодоггүй - та тэдгээрийг үр дагаварт нь үндэслэн сонгодог. [1]

✅ Түгээлтийн бус туршилт (өөрөөр хэлбэл "бодит байдал гарч ирэхэд юу болох вэ?")

Хачин хэллэг, тодорхойгүй оролт, сөргөлдөөнтэй асуултууд, шинэ ангилал, шинэ цагийн үе шатуудыг туршиж үзээрэй. Энэ нь чухал, учир нь тархалтын шилжилт нь загваруудыг үйлдвэрлэлд нүүр тулан байрлуулах сонгодог арга юм. [4]

✅ Үргэлжилсэн үнэлгээ (өөрөөр хэлбэл нарийвчлал гэдэг нь "тохируулаад март" гэсэн онцлог биш)

Системийн хэлбэлзэл. Хэрэглэгчид өөрчлөгддөг. Өгөгдөл өөрчлөгддөг. Хэрэв та үүнийг тасралтгүй хэмжихгүй бол таны "гайхалтай" загвар чимээгүйхэн доройтдог. [1]

Таны таних жижигхэн бодит ертөнцийн хэв маяг: багууд ихэвчлэн өндөр "демо нарийвчлалтай" илгээдэг бөгөөд дараа нь тэдний жинхэнэ бүтэлгүйтлийн хэлбэр нь биш , харин "өөртөө итгэлтэйгээр, өргөн хүрээнд өгсөн буруу хариултууд" гэдгийг олж мэддэг. Энэ бол зөвхөн загварын асуудал биш, үнэлгээний дизайны асуудал юм.


4) Хиймэл оюун ухаан ихэвчлэн маш нарийвчлалтай байдаг (яагаад) 📈🛠️

Асуудал нь дараах тохиолдолд хиймэл оюун ухаан гялалзах хандлагатай байдаг:

  • нарийн

  • сайн шошготой

  • цаг хугацааны явцад тогтвортой

  • сургалтын хуваарилалттай төстэй

  • автоматаар оноо авахад хялбар

Жишээ нь:

  • Спам шүүлтүүр

  • Тогтмол байрлалд баримт бичгийг гаргаж авах

  • Олон тооны санал хүсэлтийн дохио бүхий зэрэглэл/санал болгох гогцоо

  • Хяналттай орчинд харааны ангиллын олон даалгавар

Эдгээр ялалтын ихэнхийн ард байгаа уйтгартай супер хүч: тодорхой үндэслэлтэй үнэн + олон холбогдох жишээ. Тансаг биш - маш үр дүнтэй.


5) Хиймэл оюун ухааны нарийвчлал ихэвчлэн алдагддаг газар 😬🧯

Энэ бол хүмүүсийн яс махаараа мэдэрдэг хэсэг юм.

Бүтээлч хиймэл оюун ухаан дахь хий үзэгдэл 🗣️🌪️

LLM нь үнэмшилтэй боловч баримтгүй контент гаргаж чаддаг бөгөөд "үнэмжтэй" хэсэг нь яг яагаад аюултай вэ гэдэг нь энэ юм. Энэ нь хиймэл оюун ухааны эрсдэлийн удирдамж нь чичиргээнд суурилсан демо гэхээсээ илүү газардуулга, баримтжуулалт, хэмжилтэд маш их ач холбогдол өгдөг нэг шалтгаан юм . [2]

Түгээлтийн ээлж 🧳➡️🏠

Нэг орчинд сургагдсан загвар өөр орчинд бүдэрч болзошгүй: өөр хэрэглэгчийн хэл, өөр бүтээгдэхүүний каталог, өөр бүс нутгийн хэм хэмжээ, өөр цаг хугацаа. WILDS гэх мэт жишиг үзүүлэлтүүд нь үндсэндээ "түгээлтийн доторх гүйцэтгэл нь бодит ертөнцийн гүйцэтгэлийг эрс хэтрүүлж чадна" гэж хашгирах зорилгоор оршин байдаг. [4]

Өөртөө итгэлтэй таамаглалыг шагнах урамшуулал 🏆🤥

Зарим тохиргоо нь "зөвхөн мэдэж байхдаа л хариул" гэсэн зан үйлийг санамсаргүйгээр шагнадаг. Тиймээс системүүд зөв байхын оронд зөв сонсогдож сурдаг . Тиймээс үнэлгээнд зөвхөн түүхий хариултын хувь хэмжээ биш, харин түдгэлзсэн / тодорхойгүй зан үйлийг багтаах ёстой. [2]

Бодит ертөнцийн осол аваар болон үйл ажиллагааны доголдол 🚨

Хүчтэй загвар ч гэсэн систем хэлбэрээр бүтэлгүйтэж болно: муу сэргээлт, хуучирсан өгөгдөл, эвдэрсэн хашлага, эсвэл загварыг аюулгүй байдлын шалгалтаар чимээгүйхэн чиглүүлдэг ажлын урсгал. Орчин үеийн удирдамж нь нарийвчлалыг системийн өргөн хүрээтэй найдвартай байдлын. [1]


6) Дутуу үнэлэгдсэн супер хүч: тохируулга (өөрөөр хэлбэл "мэдэхгүй зүйлээ мэдэх") 🎚️🧠

Хоёр загвар ижил "нарийвчлалтай" байсан ч гэсэн нэг нь илүү аюулгүй байж болно, учир нь:

  • тодорхойгүй байдлыг зохих ёсоор илэрхийлдэг

  • хэт өөртөө итгэлтэй буруу хариултаас зайлсхийдэг

  • бодит байдалтай нийцэх магадлалыг өгдөг

Тохируулга нь зөвхөн эрдэм шинжилгээний шинж чанартай биш - энэ нь итгэлийг үйлдэлд оруулах боломжтой болгодог зүйл юм . Орчин үеийн мэдрэлийн сүлжээний сонгодог олдвор бол та тодорхой тохируулга хийхгүй эсвэл хэмжихгүй бол итгэлийн оноог жинхэнэ зөв байдалтай тааруулах боломжгүй юм. [3]

Хэрэв таны дамжуулах хоолой "0.9-өөс дээш автоматаар батлах" гэх мэт босго утгыг ашигладаг бол тохируулга нь "автоматжуулалт" болон "автоматжуулсан эмх замбараагүй байдал"-ын хоорондох ялгаа юм


7) Хиймэл оюун ухааны янз бүрийн төрлүүдэд хиймэл оюун ухааны нарийвчлалыг хэрхэн үнэлдэг вэ 🧩📚

Сонгодог таамаглалын загваруудын хувьд (ангилал/регресс) 📊

Нийтлэг үзүүлэлтүүд:

  • Нарийвчлал, нарийвчлал, эргэн санах, F1

  • ROC-AUC / PR-AUC (ихэвчлэн тэнцвэргүй асуудлуудад илүү сайн)

  • Тохируулгын шалгалт (найдвартай байдлын муруй, хүлээгдэж буй тохируулгын алдааны хэв маягийн сэтгэлгээ) [3]

Хэлний загвар болон туслахуудад зориулсан 💬

Үнэлгээ нь олон талт шинж чанартай байдаг:

  • зөв байдал (даалгавар нь үнэний нөхцөлтэй үед)

  • зааврыг дагаж мөрдөх

  • аюулгүй байдал ба татгалзах зан байдал (сайн татгалзал хачин хэцүү байдаг)

  • баримтын үндэслэл / ишлэлийн сахилга бат (таны хэрэглээний тохиолдолд шаардлагатай үед)

  • хүсэлт болон хэрэглэгчийн хэв маягийн дагуу бат бөх чанар

"Цогц" үнэлгээний сэтгэлгээний томоохон хувь нэмрүүдийн нэг нь дараах зүйлийг тодорхой болгох явдал юм: буулт хийх нь бодитой байдаг тул танд олон хувилбарын дагуу олон үзүүлэлт хэрэгтэй. [5]

LLM дээр суурилсан системүүдийн хувьд (ажлын урсгал, агентууд, сэргээх) 🧰

Одоо та бүхэл бүтэн дамжуулах хоолойг үнэлж байна:

  • Сэргээх чанар (зөв мэдээллийг авч чадсан уу?)

  • хэрэгслийн логик (энэ нь үйл явцыг дагасан уу?)

  • гаралтын чанар (зөв бөгөөд хэрэгтэй юу?)

  • хашлага (эрсдэлтэй зан авираас зайлсхийсэн үү?)

  • хяналт (та байгальд алдаа илрүүлсэн үү?) [1]

Хаана ч байсан сул холбоос нь үндсэн загвар нь дажгүй байсан ч бүхэл системийг "буруу" харагдуулж болзошгүй.


8) Харьцуулсан хүснэгт: “Хиймэл оюун ухаан хэр нарийвчлалтай вэ?”-ийг үнэлэх практик аргууд 🧾⚖️

Хэрэгсэл / арга барил Хамгийн сайн нь Зардлын уур амьсгал Яагаад ажилладаг вэ
Хэрэглээний тохиолдлын туршилтын багцууд LLM аппликейшнууд + захиалгат амжилтын шалгуурууд Чөлөөт маягийн Та санамсаргүй тэргүүлэгчдийн самбар биш, харин ажлын урсгалаа шалгадаг .
Олон хэмжигдэхүүнтэй, нөхцөл байдлын хамрах хүрээ Загваруудыг хариуцлагатайгаар харьцуулах Чөлөөт маягийн Та ганц шидэт тоо биш, харин чадварын "профайл"-ыг авах болно. [5]
Амьдралын мөчлөгийн эрсдэл + үнэлгээний сэтгэлгээ Өндөр эрсдэлтэй системүүд нь нарийн чанд байдлыг шаарддаг Чөлөөт маягийн Таныг тасралтгүй тодорхойлох, хэмжих, удирдах, хянахад түлхэц болдог. [1]
Тохируулгын шалгалт Итгэлцлийн босгыг ашигладаг аливаа систем Чөлөөт маягийн "90% итгэлтэй" гэдэг нь ямар нэгэн утгатай эсэхийг шалгадаг. [3]
Хүний хяналтын самбарууд Аюулгүй байдал, өнгө аяс, нарийн мэдрэмж, "энэ хортой санагдаж байна уу?" $$ Хүмүүс автоматжуулсан хэмжүүрүүд анзаараагүй нөхцөл байдал болон хор хөнөөлийг ойлгодог.
Ослын хяналт + санал хүсэлтийн давталт Бодит ертөнцийн алдаанаас суралцах нь Чөлөөт маягийн Бодит байдал нь баримттай байдаг бөгөөд үйлдвэрлэлийн өгөгдөл нь танд санал бодлоос илүү хурдан заадаг. [1]

Хуурамч хүлээн зөвшөөрөлтийг форматлах нь: "Free-ish" нь энд маш их ажил хийж байгаа, учир нь бодит өртөг нь ихэвчлэн лиценз биш харин хүний ​​цаг байдаг 😅


9) Хиймэл оюун ухааныг хэрхэн илүү нарийвчлалтай болгох вэ (практик хөшүүргүүд) 🔧✨

Илүү сайн өгөгдөл, илүү сайн тестүүд 📦🧪

  • Ирмэгийн тохиолдлуудыг дэлгэх

  • Ховор боловч чухал нөхцөл байдлыг тэнцвэржүүл

  • Бодит хэрэглэгчийн зовлонг илэрхийлсэн "алтан багц"-ыг хадгал (мөн үүнийгээ байнга шинэчилж байгаарай)

Бодит даалгавруудын үндэслэл 📚🔍

Хэрэв танд бодит найдвартай байдал хэрэгтэй бол итгэмжлэгдсэн баримт бичгүүдээс иш татаж, тэдгээрт үндэслэн хариулт өгдөг системийг ашиглаарай. Хиймэл оюун ухааны эрсдэлийн удирдамжийн ихэнх нь загвар нь "ажиллаж байгаа" гэж найдахаас илүү зохиомол агуулгыг бууруулдаг баримтжуулалт, гарал үүсэл, үнэлгээний тохиргоонд төвлөрдөг. [2]

Илүү хүчтэй үнэлгээний давталтууд 🔁

  • Утга учиртай өөрчлөлт бүр дээр evals ажиллуулна уу

  • Регрессийг ажиглаарай

  • Хачирхалтай өдөөлт болон хортой оролтын стрессийн тест

Тохируулсан зан үйлийг урамшуул 🙏

  • "Би мэдэхгүй" гэж хэтэрхий хатуу шийтгэх хэрэггүй

  • Зөвхөн хариултын түвшинг бус, харин татгалзах чанарыг үнэл

  • Өөртөө итгэх итгэлийг өөрийн хэмжиж, баталгаажуулдаг, харин сэтгэл хөдлөлөөрөө хүлээн авдаг зүйл биш [3]


10) Мэдлэгээ хурдан шалгах: Хиймэл оюун ухааны нарийвчлалд хэзээ итгэх ёстой вэ? 🧭🤔

Дараах үед илүү итгээрэй:

  • даалгавар нь нарийн бөгөөд давтагдах боломжтой

  • гаралтыг автоматаар шалгаж болно

  • системийг хянаж, шинэчилж байна

  • өөртөө итгэх итгэлийг тохируулсан бөгөөд үүнээс татгалзаж болно [3]

Дараах тохиолдолд бага итгэ:

  • эрсдэл өндөр бөгөөд үр дагавар нь бодитой

  • асуулт нь нээлттэй байна ("надад бүх зүйлийн талаар яриач...") 😵💫

  • газардуулга, баталгаажуулалтын алхам, хүний ​​хяналт байхгүй

  • систем анхдагчаар итгэлтэй ажилладаг [2]

Бага зэрэг алдаатай зүйрлэл: өндөр эрсдэлтэй шийдвэр гаргахдаа баталгаажаагүй хиймэл оюун ухаанд найдах нь наранд байгаа суши идэхтэй адил юм... зүгээр байж магадгүй ч таны ходоод таны бүртгүүлээгүй мөрийтэй тоглоомд автаж байна.


11) Хаалтын тэмдэглэл ба товч хураангуй 🧃✅

Тэгэхээр, хиймэл оюун ухаан хэр нарийвчлалтай вэ?
Хиймэл оюун ухаан гайхалтай нарийвчлалтай байж болно - гэхдээ зөвхөн тодорхойлсон даалгавар, хэмжилтийн арга, түүнийг байрлуулсан орчинтой харьцуулахад л. Мөн үүсгэгч хиймэл оюун ухааны хувьд "нарийвчлал" нь ихэвчлэн ганц онооноос илүү найдвартай системийн загварболох газардуулга, тохируулга, хамрах хүрээ, хяналт, шударга үнэлгээнээс хамаардаг. [1][2][5]

Товч хураангуй 🎯

  • "Нарийвчлал" гэдэг нь ганцхан оноо биш - энэ нь зөв байдал, тохируулга, бат бөх чанар, найдвартай байдал болон (үйлдвэрлэлийн хиймэл оюун ухааны хувьд) үнэн зөв байдал юм. [1][2][3]

  • Бенчмаркууд тусалдаг ч хэрэглээний тохиолдлын үнэлгээ нь таныг шударга байлгадаг. [5]

  • Хэрэв танд баримтын найдвартай байдал хэрэгтэй бол үндэслэл + баталгаажуулалтын алхамууд + түдгэлзсэн байдлыг үнэлэхийг нэмж оруулна уу. [2]

  • Амьдралын мөчлөгийн үнэлгээ бол насанд хүрэгчдийн арга барил юм... хэдийгээр энэ нь тэргүүлэгчдийн самбарын дэлгэцийн агшингаас бага сонирхолтой байсан ч гэсэн. [1]

Бодит жишээ: Хиймэл оюун ухааны дэмжлэгийн ангиллын туслахыг хэмжих

Хувилбар

Жижиг SaaS компани ирж буй дэмжлэгийн тасалбаруудыг дөрвөн дараалалд ангилахын тулд хиймэл оюун ухааныг ашиглахыг хүсч байна гэж төсөөлөөд үз дээ:

Төлбөр тооцоо

Нэвтрэх асуудлууд

Алдаа тайлан

Онцлог хүсэлтүүд

Тус компани зөвшөөрдөггүй . Түүний ажил илүү нарийссан: тасалбарыг унших, зөв ​​дарааллыг сонгох, итгэлцлийн оноо өгөх, тодорхойгүй зүйлийг хүний ​​хяналтад оруулах.

Энэ нь нарийвчлалын асуудлыг шалгахад илүү хялбар болгодог. Тодорхой "зөв" дараалал байдаг бөгөөд хүн алдааг хянаж чаддаг бөгөөд баг нь зүгээр л тустай сонсогдохын оронд хиймэл оюун ухаан тусалж байгаа эсэхийг хэмжиж чаддаг.

Туслахад юу хэрэгтэй вэ

Үүнийг зөв туршихын тулд баг дараахь зүйлийг бэлтгэдэг

100 бодит эсвэл бодит дэмжлэгийн тасалбарын шошготой туршилтын багц

Хүний шүүмжлэгчээр тохиролцсон тасалбар бүрийн зөв дараалал

Дараалал бүрт юу хамаарахыг тайлбарласан богино бодлого

Өөртөө итгэх итгэл бага үед туслах нь "хүний ​​хяналт шаардлагатай" гэж хэлэх ёстой дүрэм

Тасалбарын дугаар, хиймэл оюун ухааны дараалал, хүний ​​дараалал, итгэлцлийн оноо, хяналтын үр дүн, зарцуулсан хугацаа зэргийг агуулсан энгийн хяналтын хуудас

Жишээ заавар

Та дэмжлэгийн ангиллын туслах юм. Харилцагчийн мессежийг уншаад нэг дараалалд хуваарилна уу: Төлбөр тооцоо, Нэвтрэх асуудал, Алдааны тайлан, Функцийн хүсэлт эсвэл Хүний хяналт шаардлагатай.

Нэхэмжлэх, буцаан олголт, төлбөрийн алдаа, төлөвлөгөөний өөрчлөлт болон захиалгын асуултуудад төлбөр тооцоог ашиглана уу.

Нууц үг шинэчлэх, бүртгэлд хандах, хоёр хүчин зүйлийн баталгаажуулалт, түгжигдсэн бүртгэл эсвэл имэйл баталгаажуулалтын асуудлуудад нэвтрэх асуудлыг ашиглаарай.

Бүтээгдэхүүний баримт бичигтэй таарахгүй эвдэрсэн функцууд, алдааны мэдэгдэл, дутуу өгөгдөл, эвдрэл, эсвэл зан төлөвийн хувьд алдааны тайланг ашиглана уу.

Үйлчлүүлэгч шинэ боломж, интеграци, тохиргоо эсвэл ажлын урсгалыг сайжруулахыг хүсч байгаа үед Онцлогийн хүсэлтийг ашиглаарай.

Хэрэв мессеж тодорхойгүй, нэгээс олон асуудал агуулсан эсвэл аюулгүй байдал эсвэл нууцлалд нөлөөлж болзошгүй бол "Хүний хяналт шаардлагатай"-г сонгоно уу.

Буцаах: дараалал, 0-ээс 100 хүртэлх итгэлцэл, нэг өгүүлбэрт шалтгаан, мөн хүн үүнийг шалгах ёстой эсэх.

Үүнийг хэрхэн шалгах вэ

Үйлдвэрлэлд системд итгэхээсээ өмнө жижиг "алтан багц"-аас эхэл.

Жишээ нь:

20 төлбөрийн тасалбар

20 нэвтрэх тасалбар

20 алдааны тайлан

20 функцийн хүсэлт

20 орооцолдсон эсвэл тодорхойгүй тасалбар

Дараа нь туслахыг бүх 100 тасалбар дээр ажиллуулж, сонгосон дарааллыг хүний ​​​​баталсан дараалалтай харьцуулна уу.

Хэрэгтэй шалгалтуудад дараахь зүйлс орно

Нийт нарийвчлал: хэдэн тасалбар зөв дараалалд очсон бэ?

Дарааллын нарийвчлал: хиймэл оюун ухаан "Төлбөр тооцоо" гэж хэлэхэд хэр олон удаа төлбөр тооцоо хийдэг вэ?

Дараалалаар эргэн дурсах: хэдэн бодит төлбөрийн тасалбар барьсан бэ?

Эскалация чанар: орооцолдсон тасалбарыг хүний ​​хяналтад зөв илгээсэн үү?

Тохируулга: 90% буюу түүнээс дээш итгэлтэй гэж хэлэхэд ихэнх тохиолдолд зөв байсан уу?

Үр дүн

Жишээ үр дүн: энэ ажлын урсгалыг ашиглахаас өмнө болон дараа 100 дээжийн тасалбарын хугацааг тооцоолоход үндэслэсэн.

Туслагчийг ашиглахаасаа өмнө дэмжлэг үзүүлэх удирдагч тасалбар бүрийг гараар уншиж, чиглүүлэхэд ойролцоогоор 2 минут 30 секунд . 100 тасалбарын хувьд энэ нь ойролцоогоор 250 минутын ангиллын ажил байв.

Туслагчийг ашигласны дараа дэмжлэг үзүүлэх удирдагч нь зөвхөн хиймэл оюун ухааны дарааллын сонголтыг хянаж, итгэл багатай тохиолдлуудыг шалгасан. Шалгах хугацаа нэг тасалбар тутамд 55 секунд буюу 100 тасалбарын хувьд ойролцоогоор 92 минут болж буурсан

Энэ нь 100 тасалбар тутамд 158 минут буюу ангилах хугацаа 63% орчим бага хэмнэнэ гэсэн тооцоо юм .

Зохиомол 100 тасалбарын тестийн багцын нарийвчлал дараах байдалтай байв

Нийт дарааллын нарийвчлал: 87/100 тасалбар зөв

Өндөр итгэл үнэмшилтэй тасалбарууд 85%-иас дээш: 61 тасалбар

Өндөр итгэлцэлтэй тасалбарын нарийвчлал: 58/61 зөв

Хүний хяналтад илгээсэн тасалбар: 18 тасалбар

Тодорхойгүй тасалбаруудыг зөв өргөжүүлсэн: 15/20

Чухал нарийн ширийн зүйл нь зөвхөн 87%-ийн нарийвчлал биш юм. Илүү аюулгүй үр дүн нь туслах нь өөртөө итгэлтэй байх үедээ илүү нарийвчлалтай бөгөөд олон тодорхойгүй тохиолдлуудыг таамаглахын оронд хүнд дамжуулсан явдал юм. Энэ бол тустай автоматжуулалт болон өөртөө итгэлтэй утгагүй байдлын хоорондох ялгаа юм.

Юу буруу болж болох вэ

Хамгийн түгээмэл алдаа бол зөвхөн цэвэр жишээнүүдийг шалгах явдал юм. Жинхэнэ тасалбарууд орооцолдсон байдаг. Үйлчлүүлэгч "Надад хоёр удаа төлбөр ногдуулсан, одоо би нэвтэрч чадахгүй байна" гэж бичиж магадгүй. Энэ нь компанийн үйл явцаас хамааран төлбөр тооцоо, нэвтрэх асуудал эсвэл хүний ​​хяналт шаардлагатай байж болно.

Бусад эрсдэлд дараахь зүйлс орно:

Бүтээгдэхүүнтэй тохирохоо больсон хуучин тасалбаруудыг ашиглаж байна

Дэмжлэгийн гарын авлагад ороогүй бодлогын дүрмийг хиймэл оюун ухаанд зохиохыг зөвшөөрөх

Тохируулгыг шалгахгүйгээр итгэлцлийн оноог найдвартай гэж үзэх

Зөвхөн ерөнхий нарийвчлалыг хэмжиж, нэг дараалал дээр муу гүйцэтгэлийг дутуу үнэлдэг

Туслах нь тааж эхлэх хүртэл "Хүний хяналт хэрэгтэй" гэж маш хатуу шийтгэж байна

Сайн туршилт нь зөв өсөлтийг шагнах ёстой. Олон бизнесийн ажлын урсгалын хувьд "Би итгэлгүй байна" гэдэг нь алдаа биш юм. Энэ бол аюулгүй байдлын онцлог юм.

Практик хоол

“Хиймэл оюун ухаан хэр нарийвчлалтай вэ?” гэсэн асуултад хариулах хамгийн сайн арга бол үүнийг хийсвэрээр нь асуухаа болих явдал юм. Нэг даалгавар сонгоод, жижиг тестийн багц бүтээж, юуг зөв гэж тооцохыг тодорхойлж, алдааг ангиллаар нь хэмжиж, хиймэл оюун ухаан хэзээ ажлыг хүнд буцааж өгөхөө мэддэг эсэхийг шалгаарай. Энэ нь танд зөвхөн өнгөлсөн жишиг оноо төдийгүй сайжруулж болох тодорхой нарийвчлалын тоог өгөх болно.


Түгээмэл асуултууд

Практик байршуулалт дахь хиймэл оюун ухааны нарийвчлал

Даалгавар нь нарийн, сайн тодорхойлогдсон, таны оноож чадах тодорхой үнэнтэй холбоотой үед хиймэл оюун ухаан маш нарийвчлалтай байж болно. Үйлдвэрлэлийн хэрэглээнд "нарийвчлал" нь таны үнэлгээний өгөгдөл нь хэрэглэгчийн шуугиантай оролт болон таны систем энэ салбарт тулгарах нөхцөл байдлыг тусгасан эсэхээс хамаарна. Даалгаварууд илүү нээлттэй болох тусам (чатбот гэх мэт) газардуулга, баталгаажуулалт, хяналтыг нэмээгүй бол алдаа, өөртөө итгэлтэй хий үзэгдэл илүү олон удаа гарч ирдэг.

Яагаад "нарийвчлал" гэдэг нь таны итгэж болох нэг оноо биш юм бэ

Хүмүүс "нарийвчлал" гэдэг үгийг өөр өөр утгаар ашигладаг: зөв байдал, нарийвчлал ба санах ой, тохируулга, бат бөх чанар, найдвартай байдал. Загвар нь цэвэр туршилтын багц дээр маш сайн харагдаж болох ч хэллэг өөрчлөгдөх, өгөгдөл зөрөх эсвэл эрсдэл өөрчлөгдөхөд бүдэрдэг. Итгэлцэлд чиглэсэн үнэлгээ нь нэг тоог бүх нийтийн дүгнэлт гэж үзэхийн оронд олон үзүүлэлт, хувилбарыг ашигладаг.

Тодорхой даалгаврын хувьд хиймэл оюун ухааны нарийвчлалыг хэмжих хамгийн сайн арга

Даалгаврыг "зөв" ба "буруу" нь тодорхой бус биш, харин шалгах боломжтой байхаар тодорхойлж эхэл. Бодит хэрэглэгчид болон зах зээлийн тохиолдлуудыг тусгасан төлөөлөлтэй, шуугиантай туршилтын өгөгдлийг ашиглаарай. Ялангуяа тэнцвэргүй эсвэл өндөр эрсдэлтэй шийдвэрүүдийн хувьд үр дагаварт тохирсон хэмжүүрийг сонгоорой. Дараа нь тархалтын бус стрессийн тестийг нэмж, орчин тань өөрчлөгдөхийн хэрээр цаг хугацааны явцад дахин үнэлэлт дүгнэлтээ хийсээр байгаарай.

Практикт нарийвчлал болон санах хэлбэрийн нарийвчлал хэрхэн хэрэгждэг вэ

Нарийвчлал болон эргэн санах нь янз бүрийн алдааны зардлыг харуулдаг: нарийвчлал нь хуурамч дохиололоос зайлсхийхийг чухалчилдаг бол эргэн санах нь бүх зүйлийг барихыг чухалчилдаг. Хэрэв та спамыг шүүж байгаа бол цөөн хэдэн алдаа хүлээн зөвшөөрөгдөхүйц байж болох ч хуурамч эерэг үр дүн нь хэрэглэгчдийг бухимдуулж болзошгүй. Бусад нөхцөлд ховор боловч чухал тохиолдлуудыг алгасах нь нэмэлт тэмдэглэгээнээс илүү чухал юм. Зөв тэнцвэр нь таны ажлын урсгалд "буруу" зардал гарахаас хамаарна.

Тохируулга гэж юу вэ, энэ нь нарийвчлалд яагаад чухал вэ

Тохируулга нь загварын өөртөө итгэх итгэл бодит байдалтай тохирч байгаа эсэхийг шалгадаг - "90% итгэлтэй" гэж хэлэхэд энэ нь 90% орчимд зөв үү? Энэ нь та 0.9-өөс дээш автоматаар батлах гэх мэт босгыг тохируулах бүрт чухал юм. Хоёр загвар ижил төстэй нарийвчлалтай байж болох ч илүү сайн тохируулагдсан нь илүү аюулгүй байдаг, учир нь энэ нь хэт өөртөө итгэлтэй буруу хариултыг бууруулж, ухаалаг татгалзах зан үйлийг дэмждэг.

Хиймэл оюун ухааны нарийвчлал болон хий үзэгдэл яагаад үүсдэг вэ

Бүтээлч хиймэл оюун ухаан нь баримтад үндэслээгүй байсан ч чөлөөтэй, үнэмшилтэй текст үүсгэж чаддаг. Олон асуулт нь олон хүлээн зөвшөөрөгдөх хариултыг зөвшөөрдөг тул нарийвчлалыг тогтооход хэцүү болдог бөгөөд загваруудыг хатуу зөв байдлаас илүү "тусламжтай" байдлаар оновчтой болгож болно. Гаралтууд өндөр итгэлтэйгээр ирэхэд хий үзэгдэл онцгой эрсдэлтэй болдог. Бодит хэрэглээний тохиолдлуудын хувьд итгэмжлэгдсэн баримт бичигт үндэслэх болон баталгаажуулах алхамууд нь зохиомол контентыг багасгахад тусалдаг.

Тархалтын шилжилт болон тархалтын бус оролтыг турших

Дэлхий ертөнц өөрчлөгдөхөд түгээлтийн доторх жишиг үзүүлэлтүүд гүйцэтгэлийг хэтрүүлж болно. Систем хаана нурж байгааг харахын тулд ер бусын хэллэг, бичгийн алдаа, тодорхойгүй оролт, шинэ цагийн үе шат, шинэ ангиллуудаар туршиж үзээрэй. WILDS гэх мэт жишиг үзүүлэлтүүд нь энэ санаан дээр суурилдаг: өгөгдөл өөрчлөгдөхөд гүйцэтгэл огцом буурч болно. Стресс тестийг үнэлгээний гол хэсэг гэж үзэхээс илүүтэй сайн зүйл гэж үзэх хэрэгтэй.

Цаг хугацаа өнгөрөх тусам хиймэл оюун ухааны системийг илүү нарийвчлалтай болгох нь

Ирмэг тохиолдлуудыг өргөжүүлэх, ховор боловч чухал нөхцөл байдлыг тэнцвэржүүлэх, бодит хэрэглэгчийн зовлонг тусгасан "алтан багц"-ыг хадгалах замаар өгөгдөл болон тестийг сайжруулах. Бодит даалгаврын хувьд загвар зөв ажиллах болно гэж найдахын оронд үндэслэл болон баталгаажуулалтыг нэмэх. Утга учиртай өөрчлөлт бүр дээр үнэлгээ хийж, регрессийг ажиглаж, үйлдвэрлэлд шилжилтийг хяна. Мөн "Би мэдэхгүй" гэдэг нь итгэлтэй таамаглалд хүргэхгүйн тулд түдгэлзсэн байдлыг үнэлэх.

Лавлагаа

[1] NIST AI RMF 1.0 (NIST AI 100-1): Амьдралын мөчлөгийн туршид хиймэл оюун ухааны эрсдэлийг тодорхойлох, үнэлэх, удирдах практик хүрээ. дэлгэрэнгүй унших
[2] NIST Үүсгэх хиймэл оюун ухааны профайл (NIST AI 600-1): Үүсгэх хиймэл оюун ухааны системд хамаарах эрсдэлийн талаарх асуудлуудад чиглэсэн хиймэл оюун ухааны RMF-ийн хамтрагч профайл. дэлгэрэнгүй унших
[3] Гуо нар. (2017) - Орчин үеийн мэдрэлийн сүлжээний тохируулга: Орчин үеийн мэдрэлийн сүлжээг хэрхэн буруу тохируулж болох, тохируулгыг хэрхэн сайжруулж болохыг харуулсан үндсэн баримт бичиг. дэлгэрэнгүй унших
[4] Кох нар. (2021) - WILDS бенчмарк: Бодит ертөнцийн тархалтын өөрчлөлтийн үед загварын гүйцэтгэлийг шалгахад зориулагдсан бенчмаркийн багц. дэлгэрэнгүй унших
[5] Лян нар. (2023) - HELM (Хэлний загваруудын цогц үнэлгээ): Бодит буултуудыг илрүүлэхийн тулд хэлний загваруудыг хувилбарууд болон үзүүлэлтүүдийн дагуу үнэлэх хүрээ. дэлгэрэнгүй унших

Албан ёсны хиймэл оюун ухааны туслах дэлгүүрээс хамгийн сүүлийн үеийн хиймэл оюун ухааныг олоорой

Бидний тухай

Хиймэл оюун ухааны нарийвчлал ба үнэлгээний асуулт хариулт
1. Хиймэл оюун ухааны загваруудад "тохируулга"-ын үндсэн үйл ажиллагааны ашиг тус юу вэ?

2. WILDS бенчмарк нь бодит ертөнцийн ямар үндсэн бүтэлгүйтлийн горимыг онцгойлон онцолсон бэ?

3. Яагаад хиймэл оюун ухааны хэрэглээний "нарийвчлалыг" үнэлэх нь маш хэцүү, төвөгтэй болдог вэ?

4. Дэмжлэгийн ангиллын жишээ гэх мэт бизнесийн ажлын урсгалд аж ахуйн нэгж хөдөлгүүрийн эвдрэлээс илүү "аюулгүй байдлын онцлог" гэж юуг авч үзэх ёстой вэ?

5. Хэлний загварууд дээр суурилсан олон шатлалт системийг (RAG framework эсвэл агентлаг ажлын урсгал гэх мэт) үнэлэхдээ яагаад зөвхөн загварын оноо хангалтгүй байна вэ?


Блог руу буцах

Нэмэлт Түгээмэл Асуултууд

  • Хиймэл оюун ухааны нарийвчлалыг хэрхэн ойлгох вэ?

    Хиймэл оюун ухааны нарийвчлалыг ойлгохын тулд даалгаврыг тодорхой тодорхойлох нь чухал юм, учир нь нарийвчлал нь даалгаврыг хэр сайн тодорхойлсон болон хиймэл оюун ухаан ямар нөхцөлд ажиллаж байгаагаас хамаарч өөр өөр байж болно. Зөв байдал, нарийвчлал, санах ой, тохируулга зэрэг үзүүлэлтүүдийг үнэлэх нь хиймэл оюун ухаан хэр сайн ажиллаж байгааг ойлгоход тусална.

  • Яагаад би хиймэл оюун ухааны нэг нарийвчлалын оноонд найдаж болохгүй гэж?

    Нарийвчлал нь ганц хэмжүүр биш; энэ нь зөв байдал, найдвартай байдал, бат бөх чанар зэрэг янз бүрийн элементүүдийг хамардаг. Загвар нь цэвэр өгөгдлийн багц дээр сайн ажиллаж болох ч оролтууд харилцан адилгүй байдаг бодит ертөнцийн нөхцөлд бүтэлгүйтэж, гүйцэтгэлийг хэмжихэд ганц оноо хангалтгүй байдаг.

  • Хиймэл оюун ухааны нарийвчлалын хүрээнд тохируулга гэж юу гэсэн үг вэ?

    Тохируулга гэдэг нь загварын итгэлцлийн түвшин нь бодит гүйцэтгэлтэй нь тохирч байгаа эсэхийг баталгаажуулах үйл явцыг хэлнэ. Жишээлбэл, хэрэв хиймэл оюун ухааны алгоритм хариултын талаар 90% итгэлтэй гэж мэдэгдсэн бол тохируулга нь 90% тохиолдолд үнэхээр зөв эсэхийг шалгадаг. Энэ нь хэт итгэлтэй буруу гаралтын эрсдэлийг бууруулахад тусалдаг.

  • Цаг хугацаа өнгөрөхөд хиймэл оюун ухааны системийн нарийвчлалыг хэрхэн сайжруулах вэ?

    Цаг хугацаа өнгөрөх тусам хиймэл оюун ухааны нарийвчлалыг сайжруулахын тулд өгөгдлийн чанар болон туршилтын аргуудыг тасралтгүй үнэлж, зах зээлийн тохиолдлуудыг өргөжүүлж, бодит хэрэглэгчийн нөхцөл байдалд зориулсан "алтан багц"-ыг хадгалах хэрэгтэй. Өөрчлөгдөж буй орчинд тогтмол хяналт, стрессийн тест хийх нь системийг үр дүнтэй дасан зохицоход чухал үүрэгтэй.

  • Хиймэл оюун ухааны нарийвчлалыг үнэлэхэд ямар нийтлэг алдаа гардаг вэ?

    Нийтлэг алдаануудад бодит ертөнцийн өгөгдлийг төлөөлдөггүй цэвэр тестийн багцад хэт найдах, янз бүрийн оролтыг дуурайдаг түгээлтийн бус тестийг үл тоомсорлох, програмынхаа хуурамч эерэг эсвэл сөрөг үр дүнгийн үр дагаврыг харгалзан үзэхгүйгээр зөвхөн түүхий нарийвчлалд анхаарлаа төвлөрүүлэх зэрэг орно.

  • Бүтээлч хиймэл оюун ухаан нь нарийвчлалын ойлголтод хэрхэн нөлөөлж чадах вэ?

    Үүсгэн байгуулагч хиймэл оюун ухаан нь чөлөөтэй мэт харагдах боловч бодит байдлын хувьд зөв биш байж болох гаралтыг бий болгож, "хий үзэгдэл" гэгддэг асуудалд хүргэдэг. Үүсгэн байгуулагч хиймэл оюун ухааны нарийвчлал нь олон хүлээн зөвшөөрөгдсөн хариултыг зөвшөөрдөг тул илүү төвөгтэй байдаг тул хариултыг найдвартай эх сурвалжид үндэслэх нь чухал юм.

  • Хиймэл оюун ухааны нарийвчлалд тасралтгүй үнэлгээ яагаад чухал вэ?

    Хэрэглэгчийн зан төлөв, өгөгдөл оролт, хүрээлэн буй орчны шаардлагын өөрчлөлтөөс болж хиймэл оюун ухааны системүүд цаг хугацааны явцад алдагдаж болзошгүй тул тасралтгүй үнэлгээ хийх нь чухал юм. Тогтмол хяналт нь гүйцэтгэлийн бууралтыг тодорхойлж, шийдвэрлэх боломжийг олгодог бөгөөд системийн найдвартай байдалд итгэх итгэлийг хадгалдаг.