arrow
返回

Privacy-Aware Code-Mixed Cyberbullying Dataset for Session-Based Analysis

delete2026-03-05
delete0
PRE
AI
C
Carlin Chun Fai Chu *
C
Calvin Chun Ho Tong
C
Chun Hung Chiu
C
Chan, David Po Kin
S
Simon Ching Lam
DOI:10.3390/data11030051delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
网络欺凌行为在不同地区表现出独特性,其形成深受当地俚语、方言表达和文化背景的影响。混合代码的中文-英文口语语言(粤语)在香港、澳门和中国南部部分地区普遍使用。代码混合是指同时使用多种语言,而粤语文本包含独特的语音、词汇和句法特征,这些特征在为中文或英文应用开发的语料库中并未体现。本研究开发了一个注重隐私的混合代码网络欺凌数据集(PCCD),包含14,115条标注推文,分为1668个会话。其中个人信息和知名标识符(如名人、政治家和组织的名称)被替换为随机生成的虚拟名称。匿名数据在精确度、召回率和F-1分数方面表现出改进的性能,表明在处理未见参与者时具有更强的泛化能力。据我们所知,PCCD是首个包含施暴者和受害者身份标注的混合代码中文-英文数据集。我们的数据集有助于开发稳健的网络欺凌检测工具,研究人员和开发者可利用其准确衡量对话会话中的攻击性、攻击频率以及施暴者-受害者权力不平衡。
Keyword:
cyberbullying
code-mixed language
session-based annotation
large language models
prompt engineering

期刊

D
Data
IF:
2
论文数:
192
被引数:
2.1K

机构

S
Sun Yat sen University
学者数:
7.7K
论文数: 2.0K
被引数: 1.8W
H
Hang Seng University of Hong Kong
学者数:
350
论文数: 504
被引数: 1
Tung Wah College 封面图
Tung Wah College
学者数:
343
论文数: 313
被引数: 134
学者 查看更多机构
引用论文

引用论文

暂无论文信息