摘要:
國(guó)內(nèi)的輿情分析研究文獻(xiàn)顯示,輿情主要涵蓋分析社會(huì)的現(xiàn)實(shí)和變動(dòng)的狀況,包括引發(fā)的事件本身及相關(guān)輿論生成的因素推論。
針對(duì)當(dāng)前網(wǎng)絡(luò)輿情研究缺乏對(duì)輿情本質(zhì)的理解和系統(tǒng)的分析框架,分析結(jié)果亦只依據(jù)描述性統(tǒng)計(jì)來作出等缺憾,提出一種全新的網(wǎng)絡(luò)輿情研究路徑,以覆蓋度、測(cè)量和解釋為網(wǎng)絡(luò)輿情挖掘三大要素,搭建以人機(jī)結(jié)合的網(wǎng)絡(luò)輿情大數(shù)據(jù)分析平臺(tái),即利用機(jī)器學(xué)習(xí)和網(wǎng)絡(luò)挖掘技術(shù)初步概覽輿情面貌,再以人工在線內(nèi)容分析方法深度挖掘和解釋輿情事件。將以具體案例說明此路徑的實(shí)用性和可操作性。
關(guān)鍵詞:網(wǎng)絡(luò)輿情;大數(shù)據(jù)技術(shù);網(wǎng)絡(luò)挖掘;機(jī)器學(xué)習(xí);內(nèi)容分析
一、前言
依據(jù)中國(guó)互聯(lián)網(wǎng)絡(luò)信息中心最新的統(tǒng)計(jì)報(bào)告(2016),截至2016年6月,中國(guó)大陸互聯(lián)網(wǎng)普及率達(dá)51.6%,網(wǎng)民數(shù)量為7億人,已經(jīng)形成具有龐大規(guī)模的網(wǎng)民體量,網(wǎng)絡(luò)成為重要的輿論平臺(tái)。
隨著網(wǎng)絡(luò)輿情研究進(jìn)入大數(shù)據(jù)時(shí)代,網(wǎng)絡(luò)挖掘和機(jī)器學(xué)習(xí)等新技術(shù)使得快速甚至是即時(shí)搜集和處理大量網(wǎng)絡(luò)數(shù)據(jù)成為現(xiàn)實(shí),但是,大數(shù)據(jù)技術(shù)并非萬能,在研究和探索輿情本質(zhì)的過程中,依然需要人工判斷作為主要的分析和解釋手段,我們以此嘗試解決當(dāng)前輿情研究中缺乏整合性和系統(tǒng)性不足,甚至是被技術(shù)導(dǎo)向主宰的問題。
本研究針對(duì)網(wǎng)絡(luò)輿情研究之現(xiàn)況及需要,提出一個(gè)全新的網(wǎng)絡(luò)輿情研究路徑,以覆蓋度、測(cè)量和解釋為網(wǎng)絡(luò)輿情挖掘要素,搭建以人機(jī)結(jié)合的網(wǎng)絡(luò)輿情大數(shù)據(jù)分析平臺(tái)。在實(shí)踐方面,將整個(gè)分析框架和機(jī)制,集合于一實(shí)時(shí)數(shù)據(jù)挖掘平臺(tái)上,透過一體化的輿情監(jiān)測(cè)和分析流程,力圖達(dá)到高效、準(zhǔn)確、廣度和深度并重,以及隨時(shí)跟蹤輿情事件發(fā)展動(dòng)向之目的。
二、網(wǎng)絡(luò)輿情的概念及輿情數(shù)據(jù)的特點(diǎn)
閔大洪(2016)總結(jié)過去對(duì)輿情理論的研究成果,尤其是對(duì)概念的定義方面,匯整并形成總結(jié)性的概念定義:“輿情,系指社會(huì)的現(xiàn)實(shí)和變動(dòng)的狀況,包括各種原因引發(fā)的事件本身及相關(guān)輿論的生成。”
輿情監(jiān)測(cè)既有苗頭性又有全局性,苗頭性即是需要在事件未形成輿論之前及早察覺和監(jiān)測(cè);全局性則是指需要對(duì)社會(huì)不同階層、政經(jīng)勢(shì)力、利益相關(guān)或某一專門領(lǐng)域狀況的整體呈現(xiàn)。
目前輿論陣地已大幅度延伸至網(wǎng)絡(luò)環(huán)境中,喻國(guó)明(2010)、謝耕耘(2011)及尹培培(2013)等學(xué)者對(duì)網(wǎng)絡(luò)輿情進(jìn)行了全面論述,即是認(rèn)為網(wǎng)絡(luò)輿情是指民眾通過互聯(lián)網(wǎng)針對(duì)自己所關(guān)心或自身權(quán)益緊密相關(guān)的公共事件、社會(huì)現(xiàn)象等作出的主觀反映,是多重態(tài)度、意見等交互的綜合表現(xiàn)。
網(wǎng)絡(luò)輿情特點(diǎn)包括自由、情緒化、分散、即時(shí)、多變等,影響力強(qiáng)。網(wǎng)絡(luò)輿情監(jiān)測(cè)的總體目標(biāo)是能夠在最短的時(shí)間內(nèi)發(fā)現(xiàn)所需要監(jiān)測(cè)的輿情信息,尋找到首發(fā)的信息源,接著監(jiān)測(cè)范圍擴(kuò)大至所有涉及信息來源,并分析傳播的趨勢(shì)和范圍,時(shí)刻跟蹤事態(tài)發(fā)展及帶來的新情況(閔大洪,2016)。
相比傳統(tǒng)媒體信息,網(wǎng)絡(luò)數(shù)據(jù)內(nèi)容更新快速(Velocity),數(shù)據(jù)形式多樣(Variety),不僅限于傳統(tǒng)內(nèi)容的圖文形式,更具有視頻、動(dòng)畫等內(nèi)容形式,網(wǎng)絡(luò)輿論趨勢(shì)不確定性高(Veracity),數(shù)據(jù)體量巨大(Volume),內(nèi)容復(fù)雜(Complexity)和數(shù)據(jù)的非結(jié)構(gòu)化(Unstructured)特征明顯,蘊(yùn)含無法忽視的高價(jià)值(Value)屬性。
從數(shù)據(jù)結(jié)構(gòu)上的特點(diǎn)來說,如果數(shù)據(jù)簡(jiǎn)單、規(guī)律、重復(fù)性高,那么運(yùn)用傳統(tǒng)分析手段或簡(jiǎn)單的數(shù)據(jù)挖掘方法就能進(jìn)行歸類分析,然而,正是因?yàn)楫?dāng)前網(wǎng)絡(luò)輿情數(shù)據(jù)包括大量的社交媒體和移動(dòng)互聯(lián)網(wǎng)數(shù)據(jù)在內(nèi),數(shù)據(jù)間存在關(guān)聯(lián)性,同時(shí)呈現(xiàn)明顯的非結(jié)構(gòu)化特征(胥琳佳,2013),使其分析難度加大。
從事件特征上來說,在網(wǎng)絡(luò)輿情的環(huán)境下,傳統(tǒng)新聞敘事上的5W1H較難以辨認(rèn),不再有明確的事件發(fā)生地點(diǎn)(Where),取而代之是多樣的來源;無固定的內(nèi)容發(fā)布時(shí)間(When),即時(shí)更新成為常態(tài);人物(Who)身份模糊、隱蔽;事件(What)本身焦點(diǎn)模糊;敘事(How)散亂;欲對(duì)事件原因(Why)的挖掘,則變成了難于理解事件的背后故事;難以測(cè)量理論;更難以發(fā)現(xiàn)形態(tài)。
三、網(wǎng)絡(luò)輿情研究的現(xiàn)況與不足
因網(wǎng)絡(luò)輿情具有前述特點(diǎn),加大了輿情研究工作的難度,加上輿情監(jiān)測(cè)行業(yè)發(fā)展年份尚淺,在當(dāng)前網(wǎng)絡(luò)輿情監(jiān)測(cè)和分析領(lǐng)域中,存在諸多問題和不足。
目前國(guó)內(nèi)網(wǎng)絡(luò)輿情監(jiān)測(cè)服務(wù)機(jī)構(gòu)主要區(qū)分為三類,分別是:
(1)依托人民網(wǎng)、新華網(wǎng)等主流媒體建立的輿情監(jiān)測(cè)平臺(tái),以服務(wù)政府有關(guān)部門為主;
(2)由高校或?qū)W術(shù)機(jī)構(gòu)創(chuàng)辦的輿情研究所,具有學(xué)術(shù)傳統(tǒng);
(3)由軟件公司或其與傳統(tǒng)的市場(chǎng)調(diào)查公司聯(lián)合成立的輿情監(jiān)測(cè)軟件企業(yè),抓取互聯(lián)網(wǎng)輿情數(shù)據(jù)能力較強(qiáng)。不同的網(wǎng)絡(luò)輿情監(jiān)測(cè)機(jī)構(gòu)由于背景不同,在產(chǎn)學(xué)研等方面各有其優(yōu)勢(shì)及不足,整體而言,相關(guān)產(chǎn)業(yè)存在不同程度發(fā)展產(chǎn)品單一,同質(zhì)化嚴(yán)重或缺乏產(chǎn)業(yè)內(nèi)融合機(jī)制等問題(于新?lián)P,2015)。
多位研究者在匯總和整理當(dāng)前網(wǎng)絡(luò)輿情研究文獻(xiàn)及行業(yè)發(fā)展現(xiàn)狀后,總結(jié)認(rèn)為大數(shù)據(jù)時(shí)代下的網(wǎng)絡(luò)輿情研究學(xué)科視角單一,缺乏跨學(xué)科的有關(guān)研究,未能進(jìn)行動(dòng)態(tài)化、立體化、全局化的綜合探討,為研究而研究,研究結(jié)果難以轉(zhuǎn)化為實(shí)際應(yīng)用系統(tǒng)。整體而言,存在系統(tǒng)性不足的問題(林源,2015)。
由于當(dāng)前網(wǎng)絡(luò)輿情研究缺乏對(duì)數(shù)據(jù)的整合,未能有效地結(jié)合網(wǎng)絡(luò)輿情數(shù)據(jù)與相關(guān)外部數(shù)據(jù),導(dǎo)致數(shù)據(jù)割裂及解讀片面;研究偏于平面和孤立,未能精到地解析輿情事件或話題背后的深層原因(燕道成和姜超,2015;上海交通大學(xué)輿情研究實(shí)驗(yàn)室,2014)。
更進(jìn)一步,有研究者指出,當(dāng)前網(wǎng)絡(luò)輿情研究出現(xiàn)了技術(shù)導(dǎo)向的研究特點(diǎn),即是過于圍繞大數(shù)據(jù)展開網(wǎng)絡(luò)輿情研究,缺少對(duì)社會(huì)輿情生成、發(fā)展、演化和衰退的內(nèi)在機(jī)理來研究社會(huì)輿情信息的獲取與識(shí)別、監(jiān)測(cè)分析與預(yù)警、導(dǎo)控等治理決策方案(蔡立輝和楊欣翥,2015)。
四、新的輿情研究路徑
——大數(shù)據(jù)技術(shù)輔助網(wǎng)絡(luò)內(nèi)容挖掘與分析
本研究提出一種新的輿情研究路徑——大數(shù)據(jù)技術(shù)輔助網(wǎng)絡(luò)內(nèi)容挖掘與分析,是以人機(jī)結(jié)合基本理念的輿情研究機(jī)制,有別于當(dāng)前主流的網(wǎng)絡(luò)輿情研究手段,以改善網(wǎng)絡(luò)輿情研究遇到的方法論問題,具有挖掘廣度、深度及監(jiān)測(cè)結(jié)果更為全面和準(zhǔn)確的特點(diǎn)。
(一)新輿情研究路徑的理論框架
大數(shù)據(jù)時(shí)代,網(wǎng)絡(luò)技術(shù)手段已可以支持以普查方式覆蓋處理海量的網(wǎng)絡(luò)數(shù)據(jù),不再如傳統(tǒng)輿情信息需要抽樣以代表母體的處理方式,也由此得出了“數(shù)據(jù)足夠大的時(shí)候,就可以自己說話結(jié)論”的論斷。
然而,雖然不再擔(dān)心抽樣偏差,卻產(chǎn)生新的憂慮,即是需要考慮數(shù)據(jù)源本身的偏差。由于整體數(shù)據(jù)可能含有噪音,如不排除,則容易高估算法的精確度。同時(shí),大部分的數(shù)據(jù)是孤島狀態(tài),在整合處理時(shí),無法準(zhǔn)確地忽略和重合數(shù)據(jù),也易導(dǎo)致數(shù)據(jù)結(jié)果偏差。
可見,讓數(shù)據(jù)“自己說話結(jié)論”是危險(xiǎn)的論斷,其中需要對(duì)數(shù)據(jù)源的清理,才能避免潛在誤差。
本研究指出處理網(wǎng)絡(luò)輿情數(shù)據(jù)面臨的挑戰(zhàn),并提出以社會(huì)科學(xué)邏輯和業(yè)務(wù)思考為基礎(chǔ)的解決方式,包括覆蓋度(Coverage)、測(cè)量(Measurement)和解釋(Explanation)三大要素。
1.覆蓋度(Coverage)
覆蓋度即是解決數(shù)據(jù)是否齊全、代表性及數(shù)據(jù)質(zhì)量的問題。輿情研究中,不論是傳統(tǒng)媒體條件下還是大數(shù)據(jù)時(shí)代,相比全部數(shù)據(jù)來源,數(shù)據(jù)信息是否具有代表性更為重要。數(shù)據(jù)的過度覆蓋易引入過多的含有歧義或無關(guān)的信息,會(huì)影響算法的精確度。
同時(shí)應(yīng)高度關(guān)注關(guān)鍵字搜索的設(shè)計(jì)和操作。由于自然語言使用靈活和含義豐富,簡(jiǎn)單的關(guān)鍵字設(shè)置搜索出的數(shù)據(jù)結(jié)果,與實(shí)際所需要的數(shù)據(jù)庫結(jié)果可能存在較大偏差,從而導(dǎo)致誤差存在。
不少學(xué)者也曾經(jīng)以“谷歌流感趨勢(shì)預(yù)測(cè)”(Google Flu Trend,GFT)為例,來說明這個(gè)問題。谷歌發(fā)現(xiàn)某些搜索關(guān)鍵詞能夠很好地標(biāo)示流感疫情的現(xiàn)狀,因此,谷歌使用經(jīng)過匯總的谷歌搜索數(shù)據(jù)來預(yù)測(cè)流感疫情,并將其預(yù)測(cè)結(jié)果與美國(guó)疾病預(yù)防控制中心(Centers for Disease Control and Prevention,CDC)的監(jiān)測(cè)報(bào)告作對(duì)比。
然而在2009年,谷歌依據(jù)2008年前的資料建立起的數(shù)據(jù)模型所預(yù)測(cè)出來的結(jié)果遠(yuǎn)低于2009年實(shí)際所發(fā)生。而后,修正模型后,在2013年,其數(shù)據(jù)再次出現(xiàn)高估的問題,至此,谷歌關(guān)閉了GFT的功能,并且未再更新資料
一項(xiàng)發(fā)表在《科學(xué)》雜志的研究指出,出現(xiàn)這種結(jié)果的兩個(gè)重要原因是“大數(shù)據(jù)傲慢(Big Data Hubris)”和算法變化。
“大數(shù)據(jù)傲慢”即認(rèn)為大數(shù)據(jù)可以完全取代傳統(tǒng)的數(shù)據(jù)收集方法,而這種觀點(diǎn)最大的問題在于,絕大多數(shù)大數(shù)據(jù)與經(jīng)過嚴(yán)謹(jǐn)科學(xué)試驗(yàn)得到的數(shù)據(jù)之間存在很大的差異,因?yàn)槠浜雎粤俗罨镜挠嘘P(guān)測(cè)量、概念的信度與效度及數(shù)據(jù)之間的依賴性。
另一方面,算法本身會(huì)經(jīng)過調(diào)整和改進(jìn),算法的改變合并用戶的搜索行為或是媒體的報(bào)道,均可能會(huì)影響GFT的預(yù)測(cè),即是數(shù)據(jù)持續(xù)更新,算法無法做到隨時(shí)調(diào)整,由此帶來其結(jié)果的誤差(Lazer et al,2014)。
因此,為掌控研究質(zhì)量,需認(rèn)識(shí)到數(shù)據(jù)過度覆蓋和數(shù)據(jù)來源不足同樣易造成數(shù)據(jù)質(zhì)量不佳的情況,我們提出,輿情研究需要考慮合理的數(shù)據(jù)范圍,可利用搜索關(guān)鍵詞的邏輯設(shè)置,將輿論話題概念化,并利用可人工二度判斷的手段來解決數(shù)據(jù)覆蓋度的問題。
2.測(cè)量(Measurement)
測(cè)量即是解決可以挖掘什么的問題。
在大數(shù)據(jù)技術(shù)的協(xié)助下,機(jī)器已經(jīng)能夠完成許多自動(dòng)化的測(cè)量工作,如網(wǎng)民行為(點(diǎn)贊數(shù)、閱讀數(shù)、分享數(shù)、來源、路徑、發(fā)展趨勢(shì)、評(píng)論聲量等)及文本的情感測(cè)量,當(dāng)前輿情監(jiān)測(cè)工作較為重視對(duì)行為的測(cè)量,準(zhǔn)確度高。
但是對(duì)于態(tài)度的測(cè)量?jī)H以正負(fù)面的標(biāo)尺為主,對(duì)輿情本質(zhì),如態(tài)度或意見的強(qiáng)度、有條件式的立場(chǎng)或意向等方面的測(cè)量較為欠缺,無法分析在什么情況下的“支持”或“反對(duì)”的意向,也難以辨別不同利益相關(guān)者之間的態(tài)度差異。
再者,往往對(duì)網(wǎng)民的意見數(shù)據(jù)測(cè)量存在缺乏理論概念、甚至偷換概念的情況,如以聲量代替影響力的測(cè)量、以正負(fù)面的情感來代替滿意度和支持度等情況,因此導(dǎo)致測(cè)量效度不確定。
另一方面,以中文語義技術(shù)為手段的情感分析,準(zhǔn)確度尚不理想,與傳統(tǒng)民調(diào)結(jié)果難以相提并論。以語料匹配方式所能達(dá)到的分析準(zhǔn)確度少于60%,即便使用有優(yōu)良的訓(xùn)練集的機(jī)器學(xué)習(xí)方式,在理想的場(chǎng)景下,可將準(zhǔn)確度提高至80%(祝建華,2012),但此結(jié)果依然難以滿足需求。
因此,需要在適合輿情研究的理論框架和依據(jù)的支持下,建立具有科學(xué)性和系統(tǒng)性的測(cè)量標(biāo)準(zhǔn),才能正確地進(jìn)行輿情的深度挖掘。
解釋即是解決如何分析和解釋發(fā)現(xiàn)的問題。
網(wǎng)絡(luò)輿情的解釋度視乎分析的深度,而當(dāng)前主流的機(jī)器自動(dòng)化分析,絕大多數(shù)基于描述性分析,即是以單變量分析為主,如各種排名榜單,分析單薄,解釋性不強(qiáng),提煉洞察困難。因此,需要在掌握單變量的數(shù)據(jù)信息基礎(chǔ)之上,關(guān)注變量之間的差異和關(guān)系,以回答有意義和有深度的研究問題或檢驗(yàn)假設(shè)。
(二)大數(shù)據(jù)技術(shù)輔助網(wǎng)絡(luò)內(nèi)容挖掘與分析研究機(jī)制
基于上述對(duì)輿情研究路徑的理論框架的探討,大數(shù)據(jù)技術(shù)輔助網(wǎng)絡(luò)內(nèi)容挖掘與分析研究機(jī)制設(shè)計(jì)使用人機(jī)結(jié)合的理念,力圖避免當(dāng)前網(wǎng)絡(luò)輿情研究的誤區(qū)和偏差。
該路徑的執(zhí)行流程為,先采集網(wǎng)絡(luò)上的海量信息,再結(jié)構(gòu)化處理,隨后利用網(wǎng)絡(luò)挖掘和機(jī)器學(xué)習(xí)技術(shù),結(jié)合人工在線內(nèi)容分析,充分考慮分析結(jié)果的準(zhǔn)確度,深度挖掘輿情事件,最終獲得有價(jià)值的洞察。
1.網(wǎng)絡(luò)挖掘與機(jī)器學(xué)習(xí)
網(wǎng)絡(luò)挖掘(Web Mining)是指互聯(lián)網(wǎng)中普遍使用的數(shù)據(jù)挖掘方式。以研究目的區(qū)分,網(wǎng)絡(luò)挖掘區(qū)分為三種類型:
(1)內(nèi)容挖掘(Content Mining):以單個(gè)文件或網(wǎng)頁為分析單位,以文本分析為主,用于分析半結(jié)構(gòu)化或結(jié)構(gòu)化處理后的信息;
(2)結(jié)構(gòu)挖掘(Structure Mining):分析網(wǎng)頁的節(jié)點(diǎn)和結(jié)構(gòu),包括從網(wǎng)頁超鏈接中提取規(guī)則,或是挖掘文本結(jié)構(gòu);
(3)使用行為挖掘(Usage Mining):挖掘網(wǎng)頁訪問者的使用記錄(Herrouz et al.,2013)。
機(jī)器學(xué)習(xí)(Machine Learning)定義為“機(jī)器學(xué)習(xí)是一門人工智能的科學(xué),該領(lǐng)域的主要研究對(duì)象是人工智能,特別是如何在經(jīng)驗(yàn)學(xué)習(xí)中改善具體算法的性能(Langley,1996)”,是借助數(shù)據(jù)或以往的經(jīng)驗(yàn),以此優(yōu)化計(jì)算機(jī)程序的性能標(biāo)準(zhǔn)的方法(Alpaydin,2004)。
本研究綜合運(yùn)用網(wǎng)絡(luò)挖掘與機(jī)器學(xué)習(xí)技術(shù),結(jié)合技術(shù)專長(zhǎng)與社會(huì)科學(xué)研究知識(shí)的積累,設(shè)定合適輿情分析的網(wǎng)絡(luò)挖掘研究框架,具體為通過機(jī)器算法、語意分析技術(shù)和自動(dòng)化關(guān)鍵字匹配等技術(shù),快速挖掘網(wǎng)絡(luò)輿情信息,以描述和挖掘輿情事件或現(xiàn)象的面貌。在網(wǎng)絡(luò)挖掘的研究框架下,當(dāng)前可透過機(jī)器挖掘自動(dòng)化分析的主要面向和指標(biāo)包括(不限于):
以下分別以兩個(gè)發(fā)生在澳門的案例來說明上述的機(jī)器自動(dòng)化分析結(jié)果。
例1:臺(tái)風(fēng)“妮妲”襲澳事件
例1:臺(tái)風(fēng)“妮妲”襲澳事件輿論分析本部分以臺(tái)風(fēng)“妮妲”襲澳事件為例,透過網(wǎng)絡(luò)挖掘和機(jī)器分析結(jié)果,綜合說明輿情事件的傳播來源、傳播量度、傳播內(nèi)容、傳播特征、傳播力度、傳播效果以及不同階段的態(tài)度差異和變遷。
背景:2016年8月,臺(tái)風(fēng)“妮妲”來襲,澳門于1日下午開始懸掛3號(hào)風(fēng)球。香港天文臺(tái)1日晚8點(diǎn)40分懸掛八號(hào)西北烈風(fēng)或暴風(fēng)信號(hào)(8號(hào)風(fēng)球),澳門未有像香港懸掛8號(hào)風(fēng)球,引發(fā)社會(huì)質(zhì)疑。
觀察期內(nèi)網(wǎng)絡(luò)輿論(包括Facebook、網(wǎng)絡(luò)論壇、新浪微博和YouTube)信息量明顯高于傳統(tǒng)媒體,其中以Facebook信息量最多,占97.6%,明顯高于其他傳播來源。
進(jìn)一步觀察信息量最大的Facebook社交媒體,三個(gè)現(xiàn)場(chǎng)直播氣象局發(fā)布會(huì)的Facebook專頁獲得較高的點(diǎn)贊數(shù)、評(píng)論數(shù)和轉(zhuǎn)發(fā)數(shù),三條直播主帖短時(shí)間內(nèi)共獲得3.5萬回帖,占Facebook總帖數(shù)74.1%,引起網(wǎng)民極大回響。其中,以Facebook專頁?Lotus TV?直播發(fā)布會(huì)傳播力度最為顯著,共計(jì)獲得點(diǎn)贊數(shù)2,073個(gè),27910條回帖,轉(zhuǎn)發(fā)次數(shù)達(dá)2,491次?
三條直播主帖及其回帖談及“落臺(tái)”、“局長(zhǎng)”、“下地獄”等詞最多,負(fù)面表達(dá)較為強(qiáng)烈,對(duì)局長(zhǎng)的不滿意見明顯,要求其落臺(tái)呼聲較大。
觀察整個(gè)事件的發(fā)展趨勢(shì)及信息量,可明顯區(qū)分事件發(fā)展階段,以8月1日零時(shí)至次日15:00為升溫期,網(wǎng)絡(luò)輿情內(nèi)容有2,837條民意帖,該階段的反對(duì)態(tài)度達(dá)到75.6%,詞云圖顯示關(guān)鍵詞為“氣象局”、“妮妲”、“臺(tái)風(fēng)”等,可見民意討論集中于臺(tái)風(fēng)形勢(shì)本身;
第二階段,8月2日15:01至16:30,短短一個(gè)半小時(shí)內(nèi)網(wǎng)絡(luò)民意猛烈增加,相關(guān)民意帖達(dá)到14,018帖,事件發(fā)展至爆發(fā)期,該階段輿論反對(duì)態(tài)度擴(kuò)散至85.3%,“落臺(tái)”為最明顯的關(guān)鍵詞,信息量遠(yuǎn)超其他關(guān)鍵詞,說明該意見占據(jù)主流輿論;
隨后8月2日16:31至8月5日23:59,對(duì)該事件的探討明顯下降,網(wǎng)絡(luò)民意有9,326帖,討論進(jìn)入降溫期,反對(duì)意見稍微減少,為82.6%,但是依然高于升溫期,關(guān)鍵詞為“局長(zhǎng)”、“氣象局”、“落臺(tái)”等。
結(jié)合事件發(fā)展的趨勢(shì)及信息量,可以發(fā)現(xiàn),在輿論爆發(fā)期發(fā)帖量最為集中,同時(shí)發(fā)言的趨同性升高,由詞云圖反映出,輿論走向由對(duì)臺(tái)風(fēng)天氣本身的關(guān)注,轉(zhuǎn)向?qū)φ嚓P(guān)部門失職的問責(zé),表達(dá)出強(qiáng)烈的反對(duì)態(tài)度。
例2:“2015年澳門施政報(bào)告”四象限詞云圖
2015年11月17日下午,澳門特區(qū)政府行政長(zhǎng)官崔世安在立法會(huì)發(fā)布2016年施政報(bào)告。報(bào)告范圍包括持續(xù)提升民生素質(zhì)、促進(jìn)經(jīng)濟(jì)適度多元、建設(shè)宜居城市、深化公共行政改革等四方面。
觀察施政報(bào)告發(fā)布前后整一個(gè)月的相關(guān)輿情內(nèi)容,利用分詞、機(jī)器學(xué)習(xí)及數(shù)據(jù)可視化等一系列的技術(shù)手段,制作出四象限的詞云圖,以初步解釋輿情的度量、內(nèi)容和傳播效果。在對(duì)詞云圖解讀方面,關(guān)鍵字的字體大小表示討論聲量的多少,橫坐標(biāo)為正面及負(fù)面,縱坐標(biāo)為討論什么和怎么討論。
如上圖,在涉及“2016年澳門施政報(bào)告”的輿情中,在詞云圖左側(cè)“正面”情感方向上,網(wǎng)民討論“施政”和“政府”最多(右上角),其次為“行政”和“博彩”,與施政報(bào)告內(nèi)容和熱點(diǎn)相關(guān)議題密切相關(guān);在如何討論(右下角)中,以“直播”為涉及最多,是對(duì)信息傳播方式的討論,再次為“保障”,說明其為網(wǎng)民提及施政報(bào)告時(shí)較為關(guān)心的方面。
詞云圖右側(cè)“負(fù)面”情感方向上,左上角網(wǎng)民討論什么中,最明顯的關(guān)鍵詞為“政府”和“施政”,與政府發(fā)布施政報(bào)告議題高度相關(guān),其余較為明顯且較為相關(guān)的關(guān)鍵詞為“公屋”、“土地”、“承建商”和“房屋”,說明住房問題為網(wǎng)民討論中較為負(fù)面的議題;右下角網(wǎng)民如何討論話題以“填海”為最關(guān)鍵詞,說明該議題的動(dòng)作是討論較多負(fù)面的內(nèi)容。
2.人工在線實(shí)時(shí)內(nèi)容分析
輿情研究的本質(zhì)是為在盡可能短的時(shí)間內(nèi)于茫茫信息中獲得所需要監(jiān)測(cè)的輿情內(nèi)容,并且深入解析輿情事件的方方面面,包括前因后果,即時(shí)動(dòng)態(tài),未來可能的發(fā)展趨勢(shì)。
因此,僅掌握機(jī)器挖掘出的數(shù)據(jù)并不足夠。機(jī)器可幫助掌握包括傳播來源、傳播量度等單變量數(shù)據(jù),然而在輿情研究中多變量之間的關(guān)系和差異是社會(huì)實(shí)證研究的核心問題,因此必須引入人工分析處理機(jī)制,以尋找更為深層次的解釋。
本研究主要從差異和關(guān)系兩方面為挖掘重點(diǎn)。差異可使用交叉和聚類的方式獲得,如交叉可了解議題之間的態(tài)度差異、強(qiáng)度差異,聚類能夠幫助細(xì)分利益相關(guān)者等。對(duì)關(guān)系方面的挖掘,以相關(guān)關(guān)系、因果關(guān)系和預(yù)測(cè)及解釋力為主。
1)內(nèi)容分析法
本研究中人工在線實(shí)時(shí)內(nèi)容分析以傳統(tǒng)內(nèi)容分析法(Content Analysis)為研究方法理論依據(jù),在此基礎(chǔ)上改進(jìn)操作,以改善運(yùn)作效率、提高數(shù)據(jù)及編碼的質(zhì)量、產(chǎn)出更有信度和效度的分析結(jié)果。
內(nèi)容分析法是社會(huì)科學(xué)研究方法中的一種對(duì)文本內(nèi)容進(jìn)行編碼、分類、語義判斷及形成可供統(tǒng)計(jì)分析之用的量化分析方法。
它是指一種以系統(tǒng)、客觀與量化的方式,來研究與分析傳播內(nèi)容,藉以測(cè)量及解讀內(nèi)容的研究方法(Kerlinger,1973)。在方法設(shè)計(jì)和執(zhí)行方面,強(qiáng)調(diào):
(1)系統(tǒng)的方法,需采用隨機(jī)樣本、系統(tǒng)的類目建構(gòu)和編碼程序;
(2)客觀的程序,需遵守明確的標(biāo)準(zhǔn)與規(guī)則;
(3)量化的分析,需為所有的變量下操作性定義,確定測(cè)量標(biāo)尺,進(jìn)行統(tǒng)計(jì)分析。
傳統(tǒng)的內(nèi)容分析流程包含多個(gè)程序,設(shè)計(jì)以保證理論和操作的合規(guī)和準(zhǔn)確性。
整個(gè)流程以話題(研究題目)擬定為始,進(jìn)而進(jìn)行文獻(xiàn)探討,以確定研究問題及解釋;在對(duì)分析對(duì)象范疇的確定時(shí),可考慮對(duì)母體進(jìn)行分析,或者采取抽樣的方式,確定研究對(duì)象;通過資料搜集建立樣本集;定義分析單位后,建構(gòu)類目量化系統(tǒng),制作編碼簿,在正式編碼之前,對(duì)編碼員進(jìn)行訓(xùn)練,進(jìn)行前測(cè)編碼,計(jì)算信度,當(dāng)編碼員間信度達(dá)至一定水平時(shí),可開始正式編碼,此后輸入數(shù)據(jù),分析資料,最終獲得結(jié)果呈現(xiàn)。
內(nèi)容分析可以支持多種資料類型作為研究范疇,如采訪稿、焦點(diǎn)小組結(jié)果、教材、新聞、論文、雜志、文章、政治演講、小說、廣告、社交媒體內(nèi)容等,呈現(xiàn)的格式包括文字、圖片、音頻、視頻等。
內(nèi)容分析方法可靈活應(yīng)用于多種研究目的及不同領(lǐng)域,其中最為知名和經(jīng)典的案例之一為Harold Lasswell在一次世界大戰(zhàn)中的研究。Lasswell在其著作《世界大戰(zhàn)中的宣傳技巧》(Propaganda Technique in World War I)中以宣傳信息所使用的符號(hào)為分析對(duì)象,包括報(bào)紙、宣傳手冊(cè)、傳單、書籍、海報(bào)、電影、圖片等,發(fā)展出內(nèi)容分析法以研究宣傳運(yùn)動(dòng)中的技巧。
還有其他的研究領(lǐng)域包括有研究者利用該方法確定文章作者的著作權(quán)的比例,例如Mosteller和Wallace(1963)采用基于詞頻的貝葉斯技術(shù),解決了《聯(lián)邦主義者》(The Federalist)文章中的原作者的分布問題。
商業(yè)領(lǐng)域中,有研究者使用內(nèi)容分析法評(píng)估食品行業(yè)的發(fā)展趨勢(shì),例如,1998年有一項(xiàng)研究鈣攝入和減肥之間的關(guān)系,研究范圍是青少年和女性雜志上的廣告、文章和專欄內(nèi)容(Kondracki, Wellman, Amundson,2002)。社會(huì)服務(wù)方面,美國(guó)農(nóng)業(yè)部森林服務(wù)局(United States Department of Agriculture Forest Service)利用內(nèi)容分析法監(jiān)測(cè)社會(huì)環(huán)境對(duì)國(guó)家森林管理措施的評(píng)價(jià)意見(West,2001)。
2)編碼員之間信度(Inter-coder Reliability)
在內(nèi)容分析中,需要多于一個(gè)的編碼員來進(jìn)行編碼工作,這些獨(dú)立的編碼員對(duì)一段信息/記錄內(nèi)容的特征(也就是記錄單位)作出判斷,并且達(dá)成一致的結(jié)論。這種一致性以量化方式呈現(xiàn),稱之為編碼者間的信度。
不同的編碼員應(yīng)該對(duì)每一個(gè)分析的對(duì)象給予相同的評(píng)分(對(duì)等距或者等比標(biāo)尺而言,即使不是完全相同的數(shù)值,也應(yīng)該是相近的值),這種實(shí)質(zhì)的同意程度是檢驗(yàn)“編碼者間的信度”的基礎(chǔ)(Tinsley & Weiss,2000)。
通常我們研究的信息有明顯的內(nèi)容(manifest content)和隱藏的內(nèi)容(latent content)。對(duì)于明顯的內(nèi)容,例如文章字?jǐn)?shù)、消息來源、人物或單位名稱等,很容易以客觀的判斷來達(dá)成高度一致性。但是,對(duì)于隱藏的內(nèi)容來說,例如報(bào)導(dǎo)態(tài)度或者價(jià)值觀,編碼員必須根據(jù)他們自己的思維系統(tǒng)作出主觀的詮釋。
這樣的話,編碼員之間的相互主觀判斷變得更加重要,因?yàn)楫?dāng)這些主觀判斷由所有編碼員共享的時(shí)候,也就是它們更有可能讓讀者產(chǎn)生相同的意義(Potter and Levine- Donnerstein,1999)。
編碼員間信度評(píng)估流程由編碼指引開始,需要依據(jù)編碼簿制作編碼指引,幫助編碼員準(zhǔn)確理解編碼類目,幫助編碼員熟悉議題,理解編碼類目;之后選取少量樣本,各編碼員需要獨(dú)立進(jìn)行編碼,不可相互討論或指導(dǎo),計(jì)算信度系數(shù)以觀察不同編碼員是否已經(jīng)達(dá)到可接受的認(rèn)知一致性水平,如未能達(dá)到理想的信度水平,則需要對(duì)編碼員再次進(jìn)行培訓(xùn)和指導(dǎo),以確保編碼員達(dá)到理想信度水平,可開始正式編碼。
學(xué)術(shù)上常用的編碼員間信度有Holsti的信度系數(shù)(Holsti’s Coefficient Reliability)及Krippendorff的alpha值(Lombard,Snyder-Duch和Bracken,2002)。
3)人工在線實(shí)時(shí)內(nèi)容分析流程
在參考傳統(tǒng)內(nèi)容分析法的理論和操作方法基礎(chǔ)上,本研究建立了由大數(shù)據(jù)技術(shù)輔助人工在線實(shí)時(shí)內(nèi)容分析機(jī)制及平臺(tái)—博易數(shù)據(jù)挖掘平臺(tái)(DataMiner),整個(gè)流程包括準(zhǔn)備階段、編碼及質(zhì)量控制和結(jié)果呈現(xiàn)三大部分。
在完成前期文獻(xiàn)搜索、確定研究問題等預(yù)備工作,可于平臺(tái)上進(jìn)行準(zhǔn)備階段的設(shè)定數(shù)據(jù)源、通過設(shè)置多重關(guān)鍵詞以設(shè)定概念,在該過程中,可通過篩選工作以確保數(shù)據(jù)高度相關(guān)和精確度,并且完成編碼庫管理和設(shè)置類目的工作;
進(jìn)入編碼及質(zhì)量控制階段,該部分尤為重要,正式編碼前需要進(jìn)行前測(cè)編碼,以確保編碼員間信度達(dá)到可接受的理想水平,在正式編碼過程中,透過平臺(tái)隨時(shí)監(jiān)控編碼結(jié)果,并可定期校對(duì)以保證編碼質(zhì)量;完成上述過程后,可對(duì)結(jié)果進(jìn)行分析和可視化呈現(xiàn)。
該操作流程設(shè)置多種質(zhì)量保證機(jī)制,可隨時(shí)監(jiān)管編碼員效率、編碼準(zhǔn)確度,以確保最終的工作結(jié)果可真正為輿情研究提供價(jià)值。
下圖為線上內(nèi)容分析機(jī)制頁面,支持即時(shí)編碼、即時(shí)檢驗(yàn)、即時(shí)監(jiān)控和即時(shí)結(jié)果。
以下分別以發(fā)生在澳門的兩個(gè)案例來進(jìn)一步說明通過這種方法可以做到的分析結(jié)果。
例3:“澳門康復(fù)政策”的網(wǎng)民態(tài)度分析
在某些輿情事件中,涉及的話題面向多向且復(fù)雜,需要人工處理和區(qū)分,在此基礎(chǔ)上,才能得以進(jìn)一步解析細(xì)分議題之間的態(tài)度差異及強(qiáng)度差異。
下圖著重于對(duì)澳門的一項(xiàng)康復(fù)政策不同范疇的態(tài)度差異的解讀。康復(fù)政策為總體政策類型,下屬多個(gè)細(xì)分政策范疇,情況較為復(fù)雜,必須使用人工判斷的方式予以分類和歸整。
結(jié)果顯示,針對(duì)康復(fù)政策,除整體性的“康復(fù)服務(wù)十年規(guī)劃”,其余區(qū)分分類共14個(gè)細(xì)分范疇,進(jìn)而需要判斷這14個(gè)范疇的態(tài)度如何。
對(duì)態(tài)度的測(cè)量以七個(gè)層次劃分觀察網(wǎng)絡(luò)輿情,區(qū)分為是無條件認(rèn)同/完全認(rèn)同、主體認(rèn)同、有條件認(rèn)同、中立態(tài)度/無明確態(tài)度、有條件反對(duì)、主體反對(duì)和無條件反對(duì)/完全反對(duì)。
觀察分析結(jié)果(模擬數(shù)據(jù)),以對(duì)“公眾教育”范疇的認(rèn)同程度較高,有42.9%為“無條件認(rèn)同/完全認(rèn)同”,42.9%為“主體認(rèn)同”;觀察另一個(gè)方向的認(rèn)同程度,以“學(xué)前訓(xùn)練及托兒所”和“醫(yī)療康復(fù)”兩個(gè)方面的反對(duì)態(tài)度最為明顯,分別有22.2%和20.0%表示了“有條件反對(duì)”態(tài)度。
例4:“食品安全問題”的網(wǎng)民意向分析
另一個(gè)案例是有關(guān)食品安全的輿情分析,探討關(guān)于不同利益相關(guān)者對(duì)于食品安全所持的立場(chǎng)差異。
下圖為關(guān)于食品安全問題的分析結(jié)果,采用機(jī)器學(xué)習(xí)和人工編碼結(jié)合的方式得出。
觀察不同媒體來源中對(duì)食品安全問題的整體立場(chǎng),可以看到新聞評(píng)論、論壇、YouTube和Twitter上反對(duì)的聲音較多(71.4%、75.0%、76.9%、70.0%)。不同媒體來源對(duì)于不同利益相關(guān)者(包括政府單位、政黨和社團(tuán))的態(tài)度存在較明顯的分布差異,以Twitter上的反對(duì)聲音最多(77.8%),在論壇和新聞中表達(dá)出來的輿論聲音以中立為主(100%,89.2%)。
該案例說明,不同媒體渠道上所收集到的輿論聲音可能存在差異,對(duì)事件的看法和立場(chǎng)會(huì)不一樣。如單獨(dú)使用網(wǎng)絡(luò)挖掘,僅僅能看到整體的聲量,無法解讀到不同層次的內(nèi)容,因此可見,僅僅看傳播量等內(nèi)容是遠(yuǎn)不足夠的。
3.大數(shù)據(jù)技術(shù)與人工在線實(shí)時(shí)內(nèi)容分析的互動(dòng)和促進(jìn)關(guān)系
在本研究的網(wǎng)絡(luò)輿情研究新機(jī)制中,以人機(jī)結(jié)合為核心理念,大數(shù)據(jù)技術(shù)框架下的網(wǎng)絡(luò)挖掘和機(jī)器學(xué)習(xí)可執(zhí)行廣度的自動(dòng)化分析和快速挖掘輿情信息,人工在線內(nèi)容分析則能完成深度挖掘和解釋輿情間差異和關(guān)系的任務(wù)。
從輿情分析和解讀的整體角度出發(fā),以網(wǎng)絡(luò)挖掘及機(jī)器學(xué)習(xí)為代表的大數(shù)據(jù)技術(shù)與人工在線內(nèi)容分析兩個(gè)體系是相輔相成的關(guān)系,構(gòu)成一個(gè)良性循環(huán),且存在彼此優(yōu)化的特點(diǎn),具體體現(xiàn)在三個(gè)方面:
(1)機(jī)器技術(shù)改善人工編碼流程。通過網(wǎng)絡(luò)和計(jì)算機(jī)技術(shù)的輔助,提供編碼文本關(guān)鍵詞高亮設(shè)置,相似主題文本優(yōu)先派發(fā)等算法支持,得以提高人工編碼效率;另一方面,平臺(tái)提供快速簡(jiǎn)單的前測(cè)編碼和即時(shí)質(zhì)量監(jiān)督功能,解決了傳統(tǒng)內(nèi)容分析中編碼質(zhì)量難以控制和校正延遲的難題。
(2)詞云圖幫助制作編碼類目。利用詞云分析技術(shù),能夠快速發(fā)現(xiàn)和掌握輿情事件主要面向,從某種程度上,以關(guān)鍵詞的形式,表達(dá)了相關(guān)內(nèi)容的熱度情況。在傳統(tǒng)的人工內(nèi)容分析法中,制作編碼類目前需大量檢視相關(guān)內(nèi)容文本,以獲得對(duì)研究問題的大致了解。有詞云的幫助,其快速挖掘的關(guān)鍵詞能提供編碼類目的線索,大大改善制作編碼類目的效率及效度。
(3)人工內(nèi)容分析結(jié)果幫助改良機(jī)器學(xué)習(xí)的準(zhǔn)確度。經(jīng)過信度檢驗(yàn)的人工內(nèi)容分析所累積的大量人工編碼結(jié)果,可以作為優(yōu)質(zhì)的機(jī)器學(xué)習(xí)的訓(xùn)練集,用于改善自動(dòng)化分析結(jié)果,如情感分析,以此方式不斷提升機(jī)器分析的準(zhǔn)確度。
五、結(jié)語
回顧當(dāng)前網(wǎng)絡(luò)輿情研究發(fā)展現(xiàn)況,網(wǎng)絡(luò)輿情監(jiān)測(cè)和分析的工作難度大,面對(duì)復(fù)雜的輿論場(chǎng)景,單靠機(jī)器或人工方式無法解答我們的研究問題及現(xiàn)實(shí)需求。
為此,本研究提出新的輿情研究路徑——大數(shù)據(jù)技術(shù)輔助網(wǎng)絡(luò)內(nèi)容挖掘與分析,并通過博易數(shù)據(jù)技術(shù)公司的“博易數(shù)據(jù)挖掘平臺(tái)-DataMinder”來實(shí)現(xiàn)。
該路徑綜合匯總多年輿情研究經(jīng)驗(yàn),以社會(huì)科學(xué)實(shí)證研究的核心要素——覆蓋度、測(cè)量和解釋作為網(wǎng)絡(luò)輿情挖掘的理論框架,配合人工在線實(shí)時(shí)內(nèi)容分析方法,探索輿情事件變量間的差異與關(guān)系。其中所建立的分析機(jī)制及流程,乃將研究視角落實(shí)至研究輿情的本質(zhì),以回應(yīng)學(xué)術(shù)界、政府和業(yè)界期望了解輿情的真正意涵及價(jià)值。
本研究著重于提供一種輿情研究的思路與方法論,不限于特定輿情研究的目的和用途,適用于實(shí)務(wù)應(yīng)用,亦可用于學(xué)術(shù)研究;可用來掌握輿論形勢(shì),又可用于深度挖掘某一個(gè)話題,以解決實(shí)際問題為目的。
以上作為網(wǎng)絡(luò)輿情分析路徑上的初步嘗試,乃經(jīng)過一段時(shí)間的實(shí)踐,并已取得一定的成效。
然而作為新的探索,需要持續(xù)優(yōu)化,尤其是理論上需要強(qiáng)化和補(bǔ)充,在實(shí)踐上需要改善和提升。其中需要考慮是否能夠應(yīng)對(duì)各種輿情研究類型和情況,例如,當(dāng)需要處理的數(shù)據(jù)量特別大的時(shí)候,運(yùn)用人工內(nèi)容分析時(shí)人力部分的壓力過大,時(shí)效性會(huì)大打折扣,可考慮按照一定規(guī)則抽樣處理,如對(duì)文本內(nèi)容采用系統(tǒng)抽樣或分層隨機(jī)抽樣方式,形成可供操作的編碼樣本庫,這也是筆者提出作為未來研究和探討的一個(gè)方向。
另一個(gè)值得關(guān)注的方向是,將質(zhì)化與量化結(jié)果的相互結(jié)合解讀的研究方法論。在對(duì)輿情的研究實(shí)踐中,網(wǎng)絡(luò)挖掘和機(jī)器學(xué)習(xí)是研究輿情的第一步,可快速獲得初步的量化結(jié)果;
第二步是使用人工編碼和分析將文本內(nèi)容做量化處理,即是質(zhì)化文本材料的量化過程;
第三步是量化和質(zhì)化內(nèi)容的相互補(bǔ)充,即是以原文文本補(bǔ)充和解讀量化結(jié)果。
以此完成由質(zhì)化內(nèi)容得出量化結(jié)果,再次回到質(zhì)化內(nèi)容,量化結(jié)果與文本之間相互補(bǔ)充和解釋的循環(huán)方法論,未來或可進(jìn)一步實(shí)踐和探索該方法對(duì)輿情或其他類型研究的解釋度和操作性。
摘自:
《汕頭大學(xué)學(xué)報(bào)·網(wǎng)絡(luò)空間研究》,2016年第8期,第111-121頁。
張榮顯曹文鴛《網(wǎng)絡(luò)輿情研究新路徑:《網(wǎng)絡(luò)空間研究》
]]>