美网男单1/4决赛,创造了历史。2001年的辛纳、2003年的阿尔卡拉兹,携手打了一场历时5小时15分钟的荡气回肠的经典比赛。

阿卡以挽救赛点的方式逆转挺进四强。这两个天才,会主导5年后甚至10年后的男子网坛吧。

确实,对Big3退出后男子网球的观赏性不够的焦虑,因为这场比赛大大缓解。

过去15年,是一个瑞士人vs.一个西班牙人,后来加入了塞尔维亚色彩。过后15年,意大利vs.西班牙,不知谁会加入?

论法律大数据“领域”的构建
法治日报 2020-08-19
  □ 王禄生

  一、问题的提出:法律大数据“领域理论”的现状与不足

  (一)法律大数据领域本体论有待构建

  由于对法律大数据的领域本体论反思还较为缺乏,因此学界一般认为,法律大数据就是在法律领域中使用的具备“4V特征”的数据集。在实践中,出现了片面强调大体量、全样本、高速度、实时性、多种类的观点,甚至人为设定标准来固化地区分“大数据”与“小数据”,如PB量级才是法律大数据、没有全样本不是法律大数据等。实际上,“4V特征”并不完全适用于法律领域。因此,要推动法律大数据的研究与应用,必须构建法律大数据领域本体论,挖掘属于法律的“领域特征”。

  (二)法律大数据领域认识论有待更新

  由于缺乏对领域认识论的充分反思,当前法律大数据应用较多采取基于大数据分析的知识发现范式。具体而言,就是借助数据挖掘技术从大量判决书、案件卷宗等非结构化、半结构化数据中发现法律规律并加以应用的过程。此种认识论在大数据与大算力的支撑之下取得了一定的成效,但却与法律领域的特殊需求不完全匹配。这体现在:其一,演绎思维冲突;其二,因果思维冲突;其三,说理思维冲突。可见,为了避免在法律大数据应用中方法论与法律思维的冲突,就势必需要更新法律大数据领域认识论。

  (三)法律大数据领域方法论有待优化

  由于在本体论与认识论上套用了大数据的一般分析框架,当前法律大数据在方法论上表现为“通用技术+通用流程”的特点,也就是在数据获取、预处理、训练、解释、应用等的常见步骤中使用通用的大数据分析技术、算法与模型,没有考虑技术在法律领域的兼容性,更没有针对法律“领域知识壁垒”而进行专门的技术与流程优化。

  二、领域本体论的构建:法律大数据的“3A特征”

  (一)本体论视角下法律大数据概念的厘清

  “法律大数据”本体论的构建首先需要实现“法律领域中大数据”(big data in law)向“法律领域的大数据”(legal big data)转变。换言之,在本体论的视角下,“法律大数据”是指在立法、执法、司法等法律过程中形成或依法获取的,既在一定程度上具备大数据的通用特征,又满足适配性、正确性和易变性的领域需求,必须结合法律领域的特定算法与模型来实现辅助法律决策、优化法律过程目标的数据集。上述概念有三个关键点:其一,法律大数据是“领域大数据”而非“领域中的大数据”;其二,除了通用领域的部分特征之外,法律的特殊性使得法律大数据具有特定的领域特征;其三,法律大数据的领域特征决定了通用大数据分析工具也需要结合法律领域进行优化。

  (二)本体论视角下法律大数据的领域特征

  法律领域的特殊性决定了法律大数据除了部分具有通用大数据的“4V特征”之外,还具备从属于法律领域“3A特征”。

  第一,法律大数据的适配性(Adaptability)。与其他领域强调样本的“大与全”相比,法律大数据特别强调样本的适配性,而并不必然要求大量的全样本。第二,法律大数据的正确性(Accuracy)。在通用领域中,样本大数据质量的高低判断标准通常是纯技术的形式判断,比如数据缺失、数据重复、数据格式不统一等。一般而言,研发者并不需要对样本数据进行“对”与“错”的实质价值判断。与之形成鲜明对比的是,在法律领域中,作为各种算法训练基础的法院判决则很可能存在对错之分,法律大数据训练样本质量的高低判断除了借助技术逻辑进行形式审查之外,还需要依托专业逻辑——基于法学知识的专业判断。第三,法律大数据的易变性(Astability)。对于通用领域而言,数据的价值是相对稳定的,可以通过多次挖掘进行深度的运用,而对于法律领域而言,部分数据具有易变性,情境一经调整,原有数据将失去挖掘价值。

  三、领域认识论的更新:法律大数据的知识发现逻辑

  (一)“轻量级理论驱动”的法律大数据认识论

  大数据认识论排除理论预设、以数据分析为前置,相信只要拥有足够数据,数据本身就能够说明问题。然而,数据产生于更广泛的知识生产操作,每个学科都有自己数据想象的规范和标准,就像每个领域都有自己被接受的方法和实践的演进结构一样。完全脱离理论的大数据挖掘势必会在数据到结构化知识再到因果推断之间形成鸿沟。作为对原有大数据认识论的反思,科学界提出了“轻量级理论驱动”(lightweight theory-driven)的认识论,优化单纯以数据驱动的认识论。

  法学是社会科学的重要领域,具有鲜明的领域特殊性。考虑到通用大数据认识论与法律领域因果思维、演绎思维等方面的不相兼容性所造成的负面影响,结合法律领域特殊性的法律大数据认识论反思就显得至关重要。这就需要更新通用大数据数据驱动的经验主义认识论,构建结合法律领域特殊性的“轻量级理论驱动”法律大数据认识论,将法学理论结构映射到法律大数据的知识发现过程中。具体而言,可以从三个方面展开:首先,通过法学理论构建法学领域知识本体,明确法律大数据挖掘的结构、关系和边界;其次,通过法学理论确定适合特定目标的法律大数据子集;最后,将法学理论作为法律大数据挖掘结果的解释性框架。

  (二)新认识论驱动下的法律大数据知识发现逻辑

  在“轻量级理论驱动”的法律大数据认识论的指导下,法律大数据知识发现的逻辑也会产生相应的调整。“轻量级理论驱动”认识论指导下的法律大数据知识发现就是结合法学理论,对符合“3A特征”需求的法律大数据进行知识表示、知识抽取和知识输出的过程。具体而言,就是针对不同的主题(如类案推荐、办案证据辅助)进行知识本体构建,在知识本体构建的基础之上从各类大数据集抽取信息、训练模型、形成法律知识、装载到法律大数据仓库中并根据用户需求输出的过程。因此,法律大数据应用通常就是一个从某种法律数据中获取实质性的、有意义的知识(见解)的文本、数据挖掘过程。

  四、领域方法论的优化:法律大数据的知识壁垒及其应对

  法律大数据的“3A特征”以及“轻量级理论驱动”的知识发现方式相结合,形成了法律大数据在方法论上面临的“领域知识壁垒”。因此,在法律大数据“领域理论”的构建过程中,就必须充分了解“领域知识壁垒”的成因,进而有针对性地提出应对之策。

  (一)法律大数据“领域知识壁垒”的表现

  在技术进步话语所凸显的技术瓶颈之外,法律大数据分析的每个环节还面临明显的“领域知识壁垒”。

  首先,在法律知识表示中法律领域本体的构建需要大量法律专业知识的支撑。对此,我们可以从三个方面展开:其一,法律大数据的知识表示通常是在法律专家的知识之上建立的专家规则;其二,不同主题的知识本体有着不同程度的差异;其三,法律的领域本体还具有维度多、属性多、要素多的复杂性特点。

  其次,在法律知识发现的数据获取和数据标注环节也离不开专业知识。通用大数据领域,常人使用常识就可以实现高质量、高效率的样本标注。而在法律场景中,标注者不仅要有扎实的专业知识积累,还需要了解案件的整体事实和法律背景,从而做出准确的标注。更为重要的在于法律领域的标注还面临标准统一性的难题。不同标注人员,即使都具备深厚的法学专业知识,其对同一标注对象也可能会形成不同的判断。可见,法律领域的特殊性使得数据的获取难度和成本要大大高于通用场景。

  最后,在法律知识应用环节也存在着专业知识障碍。一方面,法律人,尤其是实务部门一线工作人员由于技术知识背景的缺乏,对技术逻辑十分陌生,不清楚技术能够解决哪些业务问题,也就无法向研发主体提出准确的大数据需求;另一方面,法律人提出的同案同判、财产保全风险预警等诸多业务需求对于技术人员而言也往往具有一定的理解障碍。横亘在法律大数据技术研发人员面前的鸿沟往往并非技术的瓶颈而恰恰可能是法律人的“常识”。

  (二)法律大数据“领域知识壁垒”的应对

  面对法律大数据的“领域知识壁垒”,需要在领域方法论上予以应对,通过推动法学与技术的有机融合,提升法律人在法律大数据研发中的地位。与此同时,结合法律大数据的领域特征,开展专有的法律大数据技术创新,而不是把法律大数据视作通用大数据技术在法律领域的平移运用。更为重要的还在于,要转变法学人才培养的模式,打造法律知识工程师的培养体系,以形成破除法律大数据“领域知识壁垒”的有生力量。

【凯特·格林威奖】#全球奖项盘点# 凯特·格林纳威奖是英国儿童图画书的最高荣誉,跟美国凯迪克大奖和国际安徒生大奖齐名,并列为“世界图画书领域三大奖”。奖项的创立主要是为纪念19世纪伟大的儿童图书插图画家凯特·格林威,该奖下设“格林威大奖”、“最佳推荐奖”和“荣誉奖”三类。其中“格林威大奖”的遴选标准严苛,插图本身及图文结合都是评审的重要元素。2017年获奖作品:《一个部落的孩子》(There is a Tribe of Kids)
2017年提名作品:《一个大大的拥抱》(A Great Big Cuddle)、《整洁》(Tidy)、《北半球野生动物》(Wild Animals of the North)、《旅途》(The Journey)、《哈利·波特和魔法石》(Harry Potter and the Philosopher's Stone)、克朗普狼(The Wolves of Currumpaw)、《马弗尔家族》(The Marvels)。


发布     👍 0 举报 写留言 🖊   
✋热门推荐
  • #李洙赫[超话]##李洙赫##handmadelove# @LEESOOHYUK 快转二改二传涂抹添加水印 请礼貌拿图[打call][打call][打call]
  • 另外,全液晶仪表、大尺寸中控屏等配置均没有缺席,满足了大家对于一台纯电动车的期待。东风EX1 PRO指导价:4.57-5.67万元➡️东风EV新能源EX1 PR
  • 唯一感叹是,人性本来就是如此真实的利己啊,无论男女,不过是在用自己已有的资源去谋取明天,爱情、婚姻对于男女而言本就意味着不同的东西。这种人人皆有的心思,被张就这
  • 功夫不负有心人,李安在对相关账本的梳理中发现了关键线索,证实了他们之间有密不可分的交易往来,容不得犯罪嫌疑人半丝狡辩。随后,相关技术部门从剪刀手柄处提取的痕迹取
  • [可乐][可乐]可乐整理精选合集[月亮]大家晚安~有其他需要的宝可在我主页搜搜看,也可留言问我哈!【[星星]午间小超市[星星]】【13.9】菲诺mini 厚椰乳
  • #田柾国0901生日快乐#我软乎乎的小宝,陪你过得第一个生日想起你的时候真的心里会软软的那段难过的日子里是你的出现拯救的我我想过只把你当一个替代品就好了已经没有
  • #约稿[超话]# 【约稿】厚涂约稿,欧美风格,头像定制,头像,半身插画,acg同人大头 120 (目前没有sample,欢迎来约第一张!欢迎咨询#约稿[超话]#
  • ②《活成你想要的样子》好久没看到我的连连日历了..这一页真的很有感觉。④谁会不喜欢懒羊羊捏~懒皇yyds[赢牛奶](讲个搞笑的。
  • 【Steam一周销量排行榜出炉,Steam Deck掌机十三连冠】 1.Steam Deck掌机 2.《命运2:光陨之秋》+年票 3.《全面战争:战锤3》 4
  • 每一次有你陪伴的每一天都是充实的,每一次为你做的每一件事都是认真的,每一次陪你走过的每一步路都是真 实的,每一次为你 争取的每一次应援都是努力的,时光荏苒,岁月
  • ꪔ̤̮今天和新舍友联络了感情 原来大家都在开学焦虑[单身狗]看到小蛇了 除了刚开始被吓到 后面都兴奋的想要踩踩我弟今晚杀疯了 因为害怕虫子的姐姐买裤子身高选了L
  • ​​负能量体的人会消耗你的时间,​破坏你的情绪,给你出各种馊点子,​整出各种莫名其妙的幺蛾子,​把你拐带进ta热爱的稀泥坑里。​​一个傻比,可以毁掉你10年的努
  • 来看‮半看‬永久眉‮客毛‬户的好评[鲜花] ‮解了‬碧悦品‮都牌‬知道,咱‮家们‬最王牌的项目就‮韩是‬式半永‮化久‬妆啦,而且我们是国内‮早最‬一批引进‮正纯
  • 从下赛季开始,如果出现榜首两支球队同分的情况,将不再采取现有(比对相互战绩、相互净胜球、总净胜球)规则,而是将让两支球队进行附加赛。两支球队将通过“争冠附加赛”
  • #手相占卜[超话]##大叔吐槽星座[超话]##算命占卜通[超话]#【化‭岁太‬‬宜早‭晚不宜‬‬】一个人的好运霉运,并不与是生俱来的。这样的小龟养足二年以上,如
  • 楷妈五味祛湿茶(无添加,纯手工) [爱心]产妇什么时间喝怀姜膏最好? 【功效】驱寒暖宫、活血养颜、预防流感、改善痛经、去除胃寒 、备孕助孕 补气血、健脾胃的好
  • #姜广涛[超话]#这段时间在三亚的生活很难熬,“生活”接连不断的给我品尝了酸甜苦辣的滋味,今天清晨挣开眼想的第一件事就是摆烂放弃,心里感觉不难过也不开心,可能是
  • 感情这东西本来就很复杂,缘分这东西也是看天意,不用烦恼也不用迷茫,该来的迟早要来,真正的喜欢一个人会觉得什么都是甜的,跟着感觉走就对了,但是我要提醒你一点,先学
  • 每个房间都是独立的木箱小包间,私密性特别好,完美复刻了韩国漫画里的那种感觉,满满的韩式style~【精选上等牛肋条】精选进口牛肋条的好吃之处就在于它的鲜嫩筋道,
  • 北欧半导体首席执行官Svenn Tore Larsen在一份声明中说:“尽管我们通过了一个里程碑,季度收入首次超过2亿美元,但我们的交付能力仍因长时间的晶圆短缺