47 KiB
Въведение в етиката на данните
![]() |
|---|
| Етика на науката за данни - Скетч нот от @nitya |
Ние всички сме граждани на данни, живеещи в свят, изпълнен с данни.
Пазарните тенденции ни казват, че до 2022 г. 1 от 3 големи организации ще купуват и продават своите данни чрез онлайн пазарни места и борси. Като разработчици на приложения ще открием, че е по-лесно и по-евтино да интегрираме прозрения, базирани на данни, и автоматизация, задвижвана от алгоритми, в ежедневните потребителски изживявания. Но тъй като изкуственият интелект става всепроникващ, ще трябва също така да разбираме потенциалните вреди, причинени от въоръжаването на такива алгоритми в голям мащаб.
Тенденциите показват, че до 2025 г. ще генерираме и консумираме над 180 зетабайта данни. За специалистите по данни този взрив на информация осигурява безпрецедентен достъп до лични и поведенчески данни. С това идва и силата да се изградят подробни потребителски профили и да се влияе плавно върху вземането на решения — често по начини, които създават илюзията за свободен избор. Докато това може да се използва за насърчаване на потребителите към предпочитани резултати, също така повдига критични въпроси за поверителността на данните, автономията и етичните граници на алгоритмичната намеса.
Етиката на данните вече са необходими ограничители за науката за данни и инженерството, които ни помагат да минимизираме потенциалните вреди и непредвидени последствия от действията ни, базирани на данни. Гартнеровият цикъл на преувеличение за изкуствения интелект идентифицира релевантни тенденции в дигиталната етика, отговорния изкуствен интелект и управлението на изкуствения интелект като ключови двигатели за по-големите мегатенденции около демократизиране и индустриализиране на ИИ.
В този урок ще разгледаме увлекателната област на етиката на данните — от основни концепции и предизвикателства до казуси и приложни концепции за ИИ като управление — които помагат да се изгради култура на етика в екипи и организации, работещи с данни и ИИ.
Квиз преди лекцията 🎯
Основни дефиниции
Нека започнем с разбирането на основната терминология.
Думата "етика" произлиза от гръцката дума "ethikos" (и нейният корен "ethos"), означаваща характер или морален характер.
Етиката се отнася до споделените ценности и морални принципи, които управляват поведението ни в обществото. Етиката не се базира на закони, а на широко приети норми за това кое е "правилно" и "грешно". Въпреки това, етичните съображения могат да влияят върху корпоративните инициативи за управление и правителствени регулации, които създават повече стимул за съответствие.
Етиката на данните е нова клонка на етиката, която "изследва и оценява морални проблеми, свързани с данните, алгоритмите и съответните практики". Тук "данни" се фокусира върху действия, свързани с генериране, записване, куриране, обработка, разпространение, споделяне и използване, "алгоритми" върху ИИ, агенти, машинно обучение и роботи, а "практики" върху теми като отговорна иновация, програмиране, хакерство и кодекси на етиката.
Прилагана етика е практическото прилагане на морални съображения. Това е процесът на активно проучване на етични въпроси в контекста на реални действия, продукти и процеси, и предприемане на корективни мерки, за да гарантира, че те остават в съответствие с нашите определени етични ценности.
Култура на етиката се отнася до операционализиране на приложната етика, за да се гарантира, че нашите етични принципи и практики се прилагат по последователен и мащабируем начин в цялата организация. Успешните култури на етика дефинират етични принципи за организацията като цяло, предоставят значими стимули за съответствие и укрепват етичните норми чрез насърчаване и усилване на желаните поведения на всяко ниво в организацията.
Етични концепции
В този раздел ще обсъдим концепции като споделени ценности (принципи) и етични предизвикателства (проблеми) за етиката на данните — и ще разгледаме казуси, които ще ви помогнат да разберете тези концепции в реални контексти.
1. Етични принципи
Всяка стратегия за етика на данните започва с дефиниране на етични принципи — "споделените ценности", които описват приемливо поведение и насочват съвместимите действия в нашите проекти с данни и ИИ. Можете да ги дефинирате на индивидуално или екипно ниво. Въпреки това, повечето големи организации ги очертават в мисионно изявление или рамка за етичен ИИ, която се дефинира на корпоративно ниво и се налага последователно във всички екипи.
Пример: Мисионното изявление на Microsoft за Отговорен ИИ гласи: "Ние се ангажираме с развитието на ИИ, ръководен от етични принципи, които поставят хората на първо място" — идентифицирайки 6 етични принципа във следната рамка:
Нека накратко разгледаме тези принципи. Прозрачността и отговорността са основополагащи ценности, върху които са изградени останалите принципи — затова нека започнем от тях:
- Отговорност прави практикуващите отговорни за операциите с данни и ИИ и за съответствието с тези етични принципи.
- Прозрачност гарантира, че действията с данни и ИИ са разбираеми (интерпретируеми) за потребителите, като обяснява какво и защо стои зад решенията.
- Справедливост — се фокусира върху осигуряване на това ИИ да третира всички хора честно, справяне с всякакви системни или имплицитни социално-технически пристрастия в данните и системите.
- Надеждност и безопасност — гарантира, че ИИ се държи последователно с определените ценности, минимизирайки потенциалните вреди или непредвидени последствия.
- Поверителност и сигурност — касае разбирането на произхода на данните и осигуряването на поверителност на данните и свързаните с това защити за потребителите.
- Инклузивност — е за проектиране на ИИ решения с намерение, пригодяването им да отговарят на широк спектър от човешки нужди и възможности.
🚨 Помислете какво би могло да бъде вашето мисионно изявление за етиката на данните. Изследвайте рамки за етичен ИИ от други организации — ето примери от IBM, Google и Facebook. Какви споделени ценности имат общо? Как тези принципи се отнасят до ИИ продукта или индустрията, в която оперират?
2. Етични предизвикателства
След като имаме дефинирани етични принципи, следващата стъпка е да оценим действията си с данни и ИИ, за да видим дали те съответстват на тези споделени ценности. Помислете за действията си в две категории: събиране на данни и проектиране на алгоритми.
При събирането на данни действията вероятно ще включват лични данни или лична идентифицираща информация (PII) за идентифицируеми живи лица. Това включва разнообразни елементи на неперсонални данни, които събранно идентифицират дадено лице. Етичните предизвикателства могат да се отнасят до професионална тайна, собственост върху данните и свързани теми като информирано съгласие и права на интелектуална собственост за потребителите.
При проектирането на алгоритми действията ще включват събиране и куриране на набори от данни, след което използването им за обучение и внедряване на модели на данни, които предсказват резултати или автоматизират решения в реални контексти. Етични предизвикателства могат да възникнат от пристрастия в набора от данни, проблеми с качеството на данните, несправедливост и погрешно представяне в алгоритмите — включително някои системни проблеми.
В двата случая етичните предизвикателства подчертават области, където действията ни могат да влязат в конфликт със споделените ни ценности. За да открием, смекчим, минимизираме или премахнем тези опасения — трябва да задаваме морални въпроси с отговор "да/не", свързани с действията ни, след което да предприемем корективни мерки при нужда. Нека разгледаме някои етични предизвикателства и моралните въпроси, които повдигат:
2.1 Собственост върху данните
Събирането на данни често включва лични данни, които могат да идентифицират субектите на данни. Собствеността върху данните се отнася до контрол и права на потребителя, свързани със създаването, обработката и разпространението на данни.
Моралните въпроси, които трябва да зададем, са:
- Кой притежава данните? (потребител или организация)
- Какви права имат субектите на данни? (например достъп, изтриване, преносимост)
- Какви права имат организациите? (например коригиране на злонамерени потребителски отзиви)
2.2 Информирано съгласие
Информираното съгласие дефинира акта на потребителите, които се съгласяват с дадено действие (като събиране на данни) с пълно разбиране на съответните факти, включително целта, потенциалните рискове и алтернативите.
Въпросите тук са:
- Потребителят (субект на данните) дал ли е разрешение за събиране и използване на данните?
- Разбрал ли е потребителят целта, за която са събрани тези данни?
- Разбрал ли е потенциалните рискове от участието си?
2.3 Интелектуална собственост
Интелектуалната собственост се отнася до нематериални творения, произтичащи от човешка инициатива, които могат да имат икономическа стойност за отделни лица или бизнеси.
Въпросите тук са:
- Имал ли е събраните данни икономическа стойност за потребител или бизнес?
- Има ли потребителят интелектуална собственост върху тях?
- Има ли организацията интелектуална собственост върху тях?
- Ако тези права съществуват, как ги защитаваме?
2.4 Поверителност на данните
Поверителността на данните или поверителността на информацията се отнася до съхраняването на поверителността на потребителя и защитата на идентичността му относно лично идентифицираща информация.
Въпросите тук са:
- Данните на потребителите са ли защитени от хакерски атаки и изтичания?
- Данните на потребителите достъпни ли са само за упълномощени потребители и контексти?
- Запазва ли се анонимността на потребителите при споделяне или разпространение на данните?
- Може ли даден потребител да бъде де-идентифициран от анонимизирани набори от данни?
2.5 Правото да бъдеш забравен
Правото да бъдеш забравен или Правото на изтриване предоставя допълнителна защита на личните данни на потребителите. По-конкретно, то дава възможност на потребителите да поискат изтриване или премахване на лични данни от интернет търсения и други места, при специфични обстоятелства — позволявайки им ново начало онлайн без да им се държат предишни действия.
Въпросите тук са:
- Позволява ли системата на субектите на данни да поискат изтриване?
- Трябва ли оттеглянето на съгласието да задейства автоматично изтриване?
- Бяха ли данните събрани без съгласие или по незаконни начини?
- Спазваме ли правителствените регулации за поверителност на данните?
2.6 Пристрастия в набора от данни
Пристрастия в набора от данни или пристрастия в събирането се отнасят до избора на нерепрезентативен поднабор от данни за разработка на алгоритми, създавайки потенциална несправедливост в резултатите за различни групи. Видове пристрастия включват селективно или пробно пристрастие, пристрастия от доброволци и инструментални пристрастия.
Въпросите тук са:
- Рекрутирахме ли представителен набор от субекти на данни?
- Тествахме ли събрания или куриран набор от данни за различни пристрастия?
- Можем ли да смекчим или премахнем откритите пристрастия?
2.7 Качество на данните
Качеството на данните разглежда валидността на курирания набор от данни, използван за разработката на нашите алгоритми, проверявайки дали характеристиките и записите отговарят на изискванията за точност и последователност, необходими за целите ни с ИИ.
Въпросите тук са:
- Заснехме ли валидни характеристики за нашия случай на използване?
- Заснехме ли данните последователно от различни източници на данни?
- Наборът от данни пълен ли е за различни условия или сценарии?
- Информацията е ли точна като отразява реалността?
2.8 Справедливост на алгоритмите
Справедливост на алгоритмите проверява дали дизайнът на алгоритъма систематично дискриминира определени подгрупи от субекти на данни, водещо до потенциални вреди при разпределението (където ресурси са отказани или задържани от тази група) и качеството на услугата (където изкуственият интелект не е толкова точен за някои подгрупи, колкото за други).
Въпросите, които да разгледаме тук, са:
- Оценихме ли точността на модела за различни подгрупи и условия?
- Анализирахме ли системата за потенциални вреди (например стереотипи)?
- Можем ли да преработим данните или да обучим отново моделите, за да намалим установените вреди?
Разгледайте ресурси като контролни списъци за справедливост на ИИ, за да научите повече.
2.9 Некоректно представяне
Некоректно представяне на данни означава да се запита дали комуникираме изводи от честно докладвани данни по заблуждаващ начин, за да подкрепим желан наратив.
Въпросите, които да разгледаме тук, са:
- Докладваме ли непълни или неточни данни?
- Визуализираме ли данните по начин, който води до подвеждащи заключения?
- Използваме ли селективни статистически техники за манипулиране на резултатите?
- Има ли алтернативни обяснения, които може да предложат различно заключение?
2.10 Свободен избор
Илюзията за свободен избор възниква, когато "архитектурите на избор" на системата използват алгоритми за вземане на решения, за да насочват хората към предпочитан резултат, докато на пръв поглед им дават възможности и контрол. Тези тъмни модели могат да причинят социални и икономически вреди на потребителите. Тъй като решенията на потребителите влияят върху профилите на поведение, тези действия потенциално насочват бъдещи избори, които могат да усилят или разширят влиянието на тези вреди.
Въпросите, които да разгледаме тук, са:
- Разбра ли потребителят последиците от вземането на този избор?
- Беше ли потребителят запознат с (алтернативни) избори и с предимствата и недостатъците на всеки?
- Може ли потребителят да отмени автоматизиран или повлиян избор по-късно?
3. Казуси
За да разгледаме тези етични предизвикателства в контекста на реалния свят, помага да разгледаме казуси, които подчертават потенциалните вреди и последици за отделните лица и обществото, когато такива нарушения на етиката се пренебрегват.
Ето няколко примера:
| Етично Предизвикателство | Казус |
|---|---|
| Информирано съгласие | 1972 - Изследване на сифилиса в Тъскеги - Афроамерикански мъже, участващи в проучването, бяха обещани безплатна медицинска помощ но бяха измамени от изследователите, които не информираха субектите за диагнозата им или за наличието на лечение. Много субекти починаха, а партньори или деца бяха засегнати; проучването продължи 40 години. |
| Поверителност на данните | 2007 - Netflix data prize предостави на изследователите 10 милиона анонимизирани класации на филми от 50 000 клиенти, за да помогне за подобряване на алгоритмите за препоръки. Въпреки това, изследователите успяха да свържат анонимизираните данни с лични данни в външни набори от данни (например коментари в IMDb) - ефективно "де-анонимизирайки" някои абонати на Netflix. |
| Събиране с пристрастия | 2013 - Град Бостън разработи Street Bump, приложение, което позволява на гражданите да съобщават за дупки по улиците, давайки на града по-добри пътни данни за откриване и отстраняване на проблеми. Въпреки това, хората от по-ниски доходни групи имаха по-малък достъп до автомобили и телефони, което направи техните пътни проблеми невидими в това приложение. Разработчиците работиха с академици за равен достъп и проблеми с цифровото разделение за справедливост. |
| Справедливост на алгоритмите | 2018 - Изследването MIT Gender Shades оцени точността на AI продукти за класификация по пол, разкривайки пропуски в точността за жени и цветнокожи лица. Apple Card през 2019 изглежда предоставяше по-малко кредит на жени, отколкото на мъже. И двата случая илюстрират проблеми с алгоритмичната пристрастност, водеща до социално-икономически вреди. |
| Некоректно представяне на данни | 2020 - Департаментът по обществено здравеопазване на Джорджия публикува графики за COVID-19, които изглежда подвеждаха гражданите относно тенденциите в потвърдените случаи чрез не-хронологично подреждане на x-оста. Това илюстрира некоректно представяне чрез трикове във визуализацията. |
| Илюзия за свободен избор | 2020 - Учебното приложение ABCmouse плати 10 милиона долара за споразумение с FTC, при което родителите бяха притиснати да плащат за абонаменти, които не можеха да отменят. Това илюстрира тъмни модели в архитектурите на избор, където потребителите бяха насочвани към потенциално вредни избори. |
| Поверителност на данните и потребителски права | 2021 - Facebook изтичане на данни разкри данни на 530 милиона потребители, в резултат на което последва споразумение с FTC за 5 милиарда долара. Въпреки това отказа да уведоми потребителите за нарушението, нарушавайки правата им на прозрачност и достъп до данни. |
Искате да разгледате още казуси? Разгледайте тези ресурси:
- Ethics Unwrapped - етични дилеми в различни индустрии.
- Курс по етика в науката за данни - разгледани са важни казуси.
- Къде нещата са се объркали - списък със случаи с примери
🚨 Помислете за казусите, които сте виждали – преживявали ли сте или били ли сте засегнати от подобно етично предизвикателство в живота си? Можете ли да посочите поне още един казус, който илюстрира някое от етичните предизвикателства, разгледани в този раздел?
Прилагана етика
Говорихме за концепции, предизвикателства и казуси, свързани с етиката в реални контексти. Но как да започнем с прилагането на етични принципи и практики в нашите проекти? И как да операционализираме тези практики за по-добро управление? Нека разгледаме някои решения от реалния свят:
1. Професионални кодекси
Професионалните кодекси предлагат една възможност на организациите да „стимулират“ членовете си да подкрепят техните етични принципи и мисия. Кодексите са морални насоки за професионално поведение, помагащи на служителите или членовете да вземат решения, които съответстват на принципите на организацията им. Те работят само при доброволно спазване от членовете; но много организации предлагат допълнителни награди и наказания, за да насърчат съответствието.
Примери включват:
- Oxford Munich Кодекс на етиката
- Data Science Association Кодекс на поведение (създаден 2013)
- ACM Кодекс на етиката и професионалното поведение (от 1993)
🚨 Член ли сте на професионална инженерна или научна организация по данни? Разгледайте сайта им, за да видите дали имат дефиниран професионален кодекс на етиката. Какво показва той за техните етични принципи? Как "стимулират" членовете си да следват кодекса?
2. Етични контролни списъци
Докато професионалните кодекси дефинират необходимото етично поведение на практикуващите, те имат известни ограничения при прилагане, особено в големи проекти. Вместо това много експерти в науката за данни препоръчват контролни списъци, които могат да свързват принципите с практиките по по-детерминиран и приложим начин.
Контролните списъци превръщат въпросите в задачи с отговор "да/не", които могат да се приведат в действие, позволявайки да бъдат проследявани като част от стандартни работни процеси за пускане на продукти.
Примери включват:
- Deon - универсален контролен списък за етика на данните, създаден от препоръки на индустрията с команден инструмент за лесна интеграция.
- Контролен списък за одит на поверителност - предоставя общи насоки за практики на съхранение на информация от правна и социална гледна точка.
- Контролен списък за справедливост на ИИ - създаден от практици на ИИ за подкрепа на прилагането и интеграцията на проверки за справедливост в цикли на разработка на ИИ.
- 22 въпроса за етика в данните и ИИ - по-отворена рамка, структурирана за първоначално изследване на етични въпроси в проектиране, изпълнение и организационен контекст.
3. Регулации по етика
Етиката се отнася до дефиниране на споделени ценности и правене на правилното нещо доброволно. Спазването е за придържане към закона там, където е дефиниран. Управлението обхваща всички начини, по които организациите функционират, за да прилагат етични принципи и да спазват установени закони.
Днес управлението приема две форми в организациите. Първо, то е свързано с дефиниране на принципи за етичен ИИ и установяване на практики за операционализиране на приемането им във всички проекти, свързани с ИИ, в организацията. Второ, то се отнася до спазване на всички правителствено налагани регулации за защита на данните за регионите, в които оперира.
Примери за регулации за защита на данните и поверителност:
1974, Американски закон за поверителност - регулира събирането, използването и разкриването на лична информация от федералното правителство.1996, Американски закон за здравно осигуряване и отчетност (HIPAA) - защитава личните здравни данни.1998, Американски закон за онлайн защита на децата (COPPA) - защитава поверителността на данните на деца под 13 години.2018, Общ регламент за защита на данните (GDPR) - предоставя права на потребителите, защита на данните и поверителност.2018, Калифорнийски закон за защита на потребителската поверителност (CCPA) дава на потребителите повече права върху техните (лични) данни.2021, Китайският Закон за защита на личните данни току-що беше приет, създавайки един от най-строгите онлайн регулации за поверителност на данни в света.
🚨 Европейският съюз дефинира GDPR (Общ регламент за защита на данните), който остава един от най-влиятелните закони за поверителност на данни днес. Знаехте ли, че той също така дефинира 8 права на потребителите, които защитават цифровата поверителност и личните данни на гражданите? Научете какви са те и защо са важни.
4. Етична култура
Обърнете внимание, че съществува нематериална разлика между спазване (направи достатъчно, за да отговаряш на „буквата на закона“) и справяне със системни проблеми (като втвърдяване, информационна асиметрия и разпределителна несправедливост), които могат да ускорят въоръжаването на ИИ.
Последното изисква съвместни подходи за определяне на етични култури, които изграждат емоционални връзки и постоянни споделени ценности в цялата индустрия. Това налага по-формализирани етични култури на данните в организациите – позволявайки на всеки да изтегли Andon кабела (за да повдигне етични въпроси в ранния етап на процеса) и правейки етичните оценки (например при наемане) ключови критерии за формиране на екипи в ИИ проекти.
Край на лекцията – тест 🎯
Преглед и самообучение
Курсове и книги помагат за разбирането на основните етични концепции и предизвикателства, докато казусите и инструментите помагат с приложната етика в реални контексти. Ето няколко ресурса за начало.
- Машинно обучение за начинаещи - урок за справедливост, от Microsoft.
- Принципи на отговорния изкуствен интелект - безплатен учебен път от Microsoft Learn.
- Етика и наука за данни - електронна книга на O'Reilly (М. Лукидис, Х. Мейсън и др.)
- Етика в науката за данни - онлайн курс от Университета на Мичиган.
- Ethics Unwrapped - казуси от Университета на Тексас.
Задача
Напишете казус за етиката в данните
Отказ от отговорност: Този документ е преведен с помощта на AI преводачески услуга Co-op Translator. Въпреки че се стремим към точност, моля имайте предвид, че автоматизираните преводи могат да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за каквито и да е недоразумения или неправилни тълкувания, произтичащи от използването на този превод.

